註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 数据采集
数据采集 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 数据采集 的搜尋結果
📍 数据采集为什么需要城市级定位? 同一航班 不同城市IP查出来👇 🇺🇸 美国随机IP → $847 ❌ 🇬🇧 伦敦本地IP → £389 ✅ 价格差2倍+ 因为IP位置不同! 需要城市定位的场景: ✈️ 机票酒店比价 🛒 电商跨国比价 🔍 本地SEO监测 📱 广告效果验证 YiluProxy 190+国家 · 城市级 · 邮编级 🆓 #数据采集# #GeoTargeting# #代理IP# #YiluProxy#
顯示更多
爬虫/数据采集必备! 每5分钟自动更新验证的免费代理池 做爬虫、搞数据采集,最怕的就是代理失效。免费代理满天飞,但真正能用的少之又少,维护起来极其痛苦。 Proxifly 这个项目把这件事做到了极致: • 每5分钟自动抓取 + 验证,只保留真正可用的代理 • 覆盖 100+ 国家,目前稳定提供数千个可用代理 • 支持 HTTP / HTTPS / SOCKS4 / SOCKS5 全协议 • 按协议和国家清晰分类,去重处理,体验极佳 • 提供 JSON / TXT / CSV 三种格式直接下载 • 还有官方 NPM 包,一行代码就能在项目里调用 网站直达(支持在线筛选): GitHub(5.8k stars): NPM:npm install proxifly 对需要大量稳定免费代理的爬虫开发者、数据采集工程师、或者做自动化脚本的同学来说,这基本是「开箱即用」级别的基础设施工具。 把最烦人的代理维护问题外包给自动化系统,你只需要专注业务逻辑就行。
顯示更多
中国自媒体数据采集神器!小红书、抖音、B站等多平台爬虫! 想系统采集小红书笔记、抖音/快手视频、B站内容、微博/知乎/贴吧帖子和评论?手动复制太慢,商业工具又贵。 MediaCrawler 这个项目把主流自媒体平台的公开数据采集做到了极致: • 覆盖平台:小红书、抖音、快手、B站、微博、百度贴吧、知乎 • 核心功能:关键词搜索、指定帖子/视频ID、二级评论、创作者主页爬取 • 技术亮点:基于 Playwright 浏览器自动化,无需 JS 逆向,支持登录态缓存 + IP 代理池,极大降低风控 • 数据导出:CSV、JSON、JSONL、Excel、SQLite、MySQL • 额外福利:内置词云生成 + WebUI 可视化界面,配置运行更友好 • CDP 模式:直接连接你本地的 Chrome,复用登录态和扩展,体验更稳 项目目前已获 54.4k stars,社区活跃,持续维护。作者还推出了 Pro 版本(支持断点续爬 + AI Agent Skill),开源版已经非常能打。 对内容创作者、数据分析师、AI 训练数据收集者、或者想学习成熟爬虫架构的开发者来说,这都是极其实用的开源工具。 GitHub:
顯示更多
机械臂训练还有一类数据,采集时甚至不需要机械臂在场。 人每天开抽屉、整理物品、拿起杯子、摆放工具,这些看起来很普通的动作,其实都包含了操作顺序、手部轨迹和对环境变化的即时判断。 Axis @axisrobotics 的移动端第一视角采集方案,可以通过手机或头戴设备记录人的日常操作,再重建手部的4D运动信息,同时补充语言描述和子任务标注。 这样得到的并不只是一段视频,而是一份带有动作过程和任务语义的数据。 仿真数据的优势是规模大、变量容易控制;第一视角数据补充的,则是现实环境里那些难以提前写进规则的细节。 比如人为什么先扶住盒子再打开盖子,遇到物体滑动时怎么改变发力,以及一个长任务该怎样拆成几个连续步骤。 机器人要学会的,最终还是人类在真实环境中处理问题的方式。把这些日常动作转成可训练的数据,可能就是连接仿真世界和现实机械臂的重要一层。
顯示更多
0
69
60
0
轉發到社區
用 Python Scrapy 框架做海外大规模数据采集,刚开 10 个并发就被目标站封 IP? 如何在不侵入业务爬虫代码的前提下,实现每一次请求自动轮换原生住宅 IP? 手把手教你编写 Scrapy 下载中间件(Downloader Middleware),打造高并发防封采集管道
顯示更多
其实机器人学习的真正瓶颈在于数据采集的成本,而非模型设计。每次新任务,几百次遥操作起步,换个场景再来一遍,永远在重复最贵的劳动。 而 @axisrobotics 与Booster的合作表明,任务对齐的模拟能够在不改变任务结构的前提下,大范围改变光照、视角和物体外观,教会策略应对各种变化。而真实的演示则专注于物理接触与执行噪声,两者互补。 实验显示,加入50%-67%的模拟数据后,策略提升率比纯真实数据高出10个百分点。仅用10次真实演示加上50条模拟轨迹,目标接触率便从0跃升至85%。 更关键的是通过持续预训练构建Booster专用基础模型,不仅使手腕-目标距离缩短67%,还让小样本微调极为高效,每任务30次演示的表现已超过原始模型60次的结果。 这一闭环数据引擎让每一次任务积累都强化整体先验,从而使得下一个任务的构建更加轻松,机器人开发由此从一次性昂贵探索走向可持续复用的工程化流程。
顯示更多
0
103
94
0
轉發到社區
今天看了一下 @axisrobotics 的数据,更直观地理解了一件事: 大家每天蹲机械臂任务,交出去的那些轨迹,真的不是在做无意义的积分小游戏。 Axis Dataset V1 用社区采集的模拟数据继续训练机器人策略后,π0.5 在 LIBERO-Plus 上的表现从 83.9% 提升到了 88.8%。 而且随着训练数据从完整数据集的 25% 一路增加到 100%,模型表现也在继续提升。 这就是 Axis 机械臂任务最核心的价值: 我们提交的每一条 data trajectory,本质上都在给机器人补训练数据。 目前 Axis 已经积累了数百万条轨迹、数万小时数据,以及数千个活跃任务,参与贡献的用户也已经来到十万级别。 机器人和大模型不太一样。 语言模型可以吃互联网上海量现成文本,但机器人真正需要的是各种环境、动作、物体和操作场景的数据。 数据覆盖得越广,机器人学到的情况越多,未来从模拟环境走进真实世界时,面对各种意外和变化的适应能力才会更强。 所以再回头看 Axis 的机械臂任务,它不只是“做任务奖励积分”。 更像是把原本集中在实验室里的机器人数据采集,拆成了一个全球用户都可以参与的数据生产网络。 这是我觉认为 @axisrobotics 比单纯发积分更有价值的地方。 积分是激励,数据才是真正的产品。 测试网入口: @axisrobotics @KaitoAI
顯示更多
0
71
61
0
轉發到社區
刚入局跨境电商、TikTok 矩阵或数据采集,还在手动挨个填代理端口? 其实直接一键复制整串代理信息,指纹浏览器和小火箭就能秒级自动解析! 5 分钟开箱上手 SOP,手把手带你完成出海多环境防关联物理隔离
顯示更多
做跨境电商、社媒养号和数据采集,动态IP和静态IP到底该怎么选?选错不仅多花冤枉钱,还容易被批量封号。 一文搞懂动态住宅与静态住宅IP核心差异与避坑选型指南
顯示更多
我觉得 Whoop、Oura 这类健康硬件数据采集公司,得用一个新的框架重新估值,虽然现在都已经 10B 的估值了。 大家可能还是把它们看成 wearable / health tech 公司,但如果 World Model 和 Physical AI 继续发展,它们真正稀缺的资产是过去几年持续积累的真实世界的身体和行为数据。 所以还是卖数据牛逼,他们占据的是 AI 理解真实人类健康的长期数据入口,反正我挺看好能潜移默化采集人的身体、行为、思考(最主要)数据的公司。 未来硬件公司的第一核心指标,不再是它卖出去多少设备,而是它通过这些设备占据了多少“AI 在现实世界的数据入口”。 Physical AI 最重要的一环🤖
顯示更多
0
28
26
1
轉發到社區