注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 SCRAP
SCRAP 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 SCRAP 的推特
兄弟们,今天聊个经典——Scrapy, 做过爬虫的都用过它——62000个Star,Python爬虫框架里的老大哥 不是新项目,是 2008 年就出来的老家伙,到现在还是 Python 爬虫的第一选择。 一句话:一套完整的爬虫框架,从抓取到数据清洗到存储,流水线全给你搭好了。 为什么 15 年了还没被取代? (1)Spider 架构——每个爬虫是一个独立的 Spider 类,定义好起始 URL 和解析逻辑,Scrapy 自动调度、并发跑,写完可以直接复用 (2)CSS 和 XPath 双选择器——精准提取页面数据,嵌套结构、动态列表都能处理,写过几次就形成肌肉记忆 (3)Item Pipeline 流水线——数据抓回来之后,清洗、去重、写数据库、存文件,每一步都是独立模块,插拔自由,不用自己手写 ETL (4)中间件系统——自动限速、代理轮换、Cookie 管理、重试逻辑,全都有内置支持,反爬场景下加几行配置就解决 (5)Scrapy Shell 交互调试——不用跑完整爬虫,直接开一个 Shell,对着真实页面测选择器,调好了再写进代码 (6)内置导出——JSON、CSV、XML,一行命令出文件,不用另接数据处理库 装一行: pip install scrapy 新建项目: scrapy startproject myproject scrapy genspider example  scrapy crawl example -o output.json 什么场景适合用 Scrapy: 电商价格监控、新闻聚合、竞品数据采集、AI 训练数据集构建——只要是需要批量、定期、稳定地抓取网页数据,Scrapy 都是最省心的选择。 它不适合的场景:需要处理大量 JS 渲染的动态页面(这种场景配 Playwright 或用 Crawl4AI)。 62000 个 Star,活跃维护了 15 年,背后是 Zyte 公司在撑着。 爬虫这件事,选老的就是选稳的。 好东西转给需要的兄弟。🚀 #Python# #爬虫# #老杨啊分享#
显示更多
现在连给 Agent 录 demo 这件事,都开始有现成命令了 shot-scraper 1.10 新加的 video 命令,可以按 storyboard.yml 跑一段网页流程,再直接录成演示视频 它底层还是 Playwright,但把录屏动作包装成了 Agent 看得懂、也能自己调用的步骤 以后做功能验证,交付物不一定只是 PR,还可能顺手带一段能看的操作录像.
显示更多
这个卖家精灵的MCP很贵啊。查看评论就要算一次MCP调用。 这个看来还是要自己搭amazon爬虫啊。 除了ScraperAPI外大家用啥爬虫?
0
52
12
0
转发到社区
xcrawl skill 主要有这几个: * Search 获取不同国家地区 Google、亚马逊等平台的数据 * Map 爬取网站 URL 列表 * Crawl 抓取整个网站 * Scrape 抓取单个网页 我链接注册就有送 1000 次调用,很够用
显示更多
Github上这个AI找工作的仓库火了🔥 我原本以为 AI 求职就是帮你改改简历,结果有人直接把整个找工作流直接搭出来了! 作者自己就是第一批小白鼠:2025 年底被裁后,用这套东西跑了 69 份定制申请 → 20 次一面 → 最后拿到合同,2026 年 6 月转成 AI Engineer。这个仓库 3 月才创建,现在已经 3.4 万+ Stars。 把自己的 LinkedIn、学历、过去申请记录丢进去,它先建立一份长期职业档案。之后 /scrape 自动找岗位并去重,/rank 按你的技能、经历、地点、语言和职业目标批量打分,真正值得投的再进 /apply。 最爽的是 /apply 不是“给我写一份简历”这么简单。 它会先判断匹配度,再针对 JD 重写 CV 和求职信,然后再拉一个 Reviewer Agent 当招聘经理挑刺,检查关键词、经历真实性、公司针对性,修改完还会编译成 PDF、检查 ATS 能不能正常读取。 而且这套系统会记账:投过什么、面了几轮、被拒还是拿 Offer,都能留下来。后面面试时,它直接拿当时那份 JD + 你真正投出去的 CV + 求职信 + 前几轮反馈给你准备,而不是重新瞎猜。 甚至还能读 Gmail 找面试邀请、拒信和 Offer,再同步到自己的求职 Pipeline。 这才是我觉得这个项目最聪明的地方:它不是拿 AI 帮你写求职材料,而是把“找工作”本身做成了一套 Agent 工作流。 GitHub:
显示更多
🔥太强了,firecrawl 这个项目能把整个互联网直接变成喂给 AI 的干净数据。 GitHub 揽获 14.8 万 Star,是 AI 爬虫这条赛道里最强的开源项目。 以前自己写爬虫,光是搞定代理轮换、反爬限流、JS 渲染这些坑就要折腾好几天,抓下来的 HTML 还得再花时间清洗才能喂给模型。 现在一个 Scrape 接口调用,直接吐出干净的 Markdown 或结构化 JSON,网页上挂的 PDF、DOCX 也能顺带解析出来。 想抓整站就用 Crawl,一个请求把全站内容收回来; 只想先摸清站点结构就用 Map,秒级发现所有 URL; 批量任务丢给 Batch Scrape 异步跑,几千个 URL 也不用自己管队列。 遇到需要先点击、滚动、输入才能看到内容的页面,也能先执行完动作再抓取。 官网注册拿到 API key,一条 curl 命令就能跑起来,也能一条命令直接接入 MCP,让任何 AI agent 自己联网找资料。
显示更多
Meta Muse Image 三天被叫停,为什么“默认 Opt-out”的逻辑会翻车? Meta 7月7日高调推出首款原生 AI 生图工具 Muse Image,允许用户 @ 任何公开 Instagram 账号,直接生成该账号形象的 AI 图片。但仅仅三天后,在演员 Hannah Einbinder 的公开批评和 SAG-AFTRA(演员工会)的施压下,Meta 承认“未达预期”,迅速下线了该功能。 硅谷巨头为何在核心产品上遭遇如此滑铁卢?这不仅是一次产品经理的激进冒险,更是科技巨头对用户数字资产主权的一次“越界试探”。让我们来捋清这条时间线背后的深层逻辑。👇 💡 核心争议点:“默认退出(Opt-out)”本质上是一种强盗逻辑 Muse Image 默认对所有公开 Instagram 账号启用了被引用权限。如果不想被生成,用户必须自己去迷宫般的设置里大海捞针,主动关闭(Opt-out)。更致命的是,当你的照片被别人当作提示词参考生成时,你不会收到任何通知。 SAG-AFTRA 首席谈判代表 Duncan Crabtree-Ireland 直言:这种未经同意就创建非自愿数字替身(digital replicas)的做法是“不可接受的”。 态度补充: 为什么“默认 Opt-out”会在隐私上翻车?这涉及到一个核心预期违背:用户将照片设为“公开”,预期是“被真人观看并产生社交连接”,而不是“被 AI 拿去当做免费的赛博二创素材”。当平台粗暴地将“公开可见”等同于“可被 AI 随意加工”,实际上是在用技术强权剥夺用户对自身数字形象的绝对控制权。真正的尊重从不搞“先斩后奏”,应该是“默认关闭,选择加入(Opt-in)”,将决定权完完整整地还给用户。 🔍 划清界限:外网讨论在混淆什么? 在这场风波中,外网讨论也出现了严重的逻辑混淆。我们需要明确区分两个完全不同的法律和技术概念: 1. 训练模型(Training): 用海量数据训练底层大模型。 2. 参考生成(Inference/Generation): 在具体生成时,提取特定账号照片作为视觉参考(这是 Muse Image 此次的直接风暴眼)。 这两者虽然都涉及“AI 使用照片”,但在技术实现和法律定性上是完全不同的行为。 关于“训练模型”,业界的争议点主要在于版权例外、合理使用(Fair Use)和大规模数据抓取(Scraping)。而关于“参考生成”,则直接触及了肖像权、公开权(Right of Publicity)以及可能导致的虚假代言风险。 Meta 的技术博客显示,Muse Image 具备多参考图组合能力。这从技术上说明它是在生成阶段实时调用照片,而不是把照片重新塞回底层模型去“炼丹”。把这两者混为一谈,只会稀释公众的维权火力,无助于准确向巨头追责。 ⚖️ 法律的真空期,成了巨头的“特权测试场” 那么,现有的法律管得了“参考生成”吗? 在欧洲: GDPR 规定个人数据处理必须有合法基础。虽然公开照片不自动等于“生物识别数据”,但平台仍需说明其合法利益,并满足极高的透明度要求。而将于 2026 年 8 月适用的《欧盟 AI Act》第50条虽然规定深度伪造(deep fake)内容必须进行披露,但必须警惕:“贴上了 AI 标签”绝不等于“拿到了合法授权”。 在美国: 情况则更加碎片化。美国版权局早在 2024 年 7 月发布的《数字替身报告》中就指出,现有州层面的公开权、隐私法覆盖不一,呼吁建立新的联邦级数字替身法律。目前,是否构成侵权往往取决于各州的具体法律、使用目的(是否商业化)、以及是否造成公众混淆等。 法律的滞后和条款的灰色地带,恰恰给了科技巨头不断试探公众底线、通过“小步快跑”侵占用户权益的空间。 🛎️ 这场风波给普通人的警示 你发在社交平台的照片,平台能不能默认拿去喂 AI 或参考生成? 答案是:在现有平台那几万字的隐私协议下,他们往往认为自己拥有这个权利——直到他们遭遇如这次一般强烈的公众反弹和法律铁拳。 面对长篇大论的英文隐私条款、复杂的国际法案以及外网关于 AI 伦理的激烈辩论,语言不应成为我们了解真相、捍卫权利的障碍。 使用 沉浸式翻译 ,你可以一键双语对照阅读外媒第一手报道、科技巨头官方公告和最新的国际法律文件。别让复杂的术语剥夺你的知情权。 保持警惕,保持阅读。不要让你的数字化身,成为巨头免费的盘中餐。🌐✨
显示更多
把网页直接复制给 AI,广告、导航、乱码都会一起被塞进去。 这 6 个免费工具专门把网页、PDF、Office 文档抓成 LLM 最擅长处理的 Markdown,做 RAG、做爬虫、喂上下文都靠它们。 1、MarkItDown(162k star) 微软出的万能转换器,PDF、Word、PPT、Excel、图片一股脑转成 Markdown,喂 AI 前的标准预处理,装机量爆炸。 2、Firecrawl(142.8k star) 一个接口把整站爬下来转成干净 Markdown,自动处理动态渲染和反爬,做 AI 应用抓知识库的首选,去年最火的爬虫。 3、Crawl4AI(70.7k star) 专为 LLM 设计的开源爬虫,输出结构化、对 AI 友好,能按你给的 schema 直接抽字段,完全免费自托管。 4、Scrapy(62.8k star) Python 爬虫的老牌框架,大规模、高并发抓数据的工业级选择,要爬几百万页的选它。 5、Katana(17.1k star) 新一代爬取和链接发现框架,速度极快,安全测试和资产盘点常用它先把一个站的 URL 全扒出来。 6、Jina Reader(11.4k star) 最省事的一个,任何网址前面加 ` 就返回干净正文,不用装东西,临时抓一篇文章塞给 AI 秒出。
显示更多
《Seraph Of Rebirth/炽天使之涅槃》 Model @poxbe2 Photo @WhisperFrame POP Art Style picture created by ME. Thank you for the reference 原本想出手绘版本但是火焰色差对我来说有点难画巧合的是这两天正在出这个主题所以便用AI生成这个主题部分画是POP Art 风格的图,该主题很适配该风格❤️。
显示更多
Seraph · Rebirth / 炽天使 · 涅槃 🪽 Model @poxbe2 Photo @WhisperFrame
0
44
636
21
转发到社区