别再问 AI:现在网上的人都怎么看这个东西?
大多数时候,它给你的只是一个“听起来很合理”的答案。
更狠的玩法是:
先把几千条真实帖子和评论抓回来,再让 AI 分析。
它可以采集小红书、抖音、B站、微博、知乎、贴吧、快手等平台的公开内容。
帖子、视频、评论、博主主页,都可以按关键词去找。
我第一反应不是拿它“爬数据”。
而是:这东西完全可以拿来给 AI 建一个真实世界的研究素材库。
比如我最近想研究:
大家到底有没有在用 AI Agent?
以前怎么做?
小红书搜一下。
抖音翻一下。
B站看看评论。
微博再搜一遍。
知乎找几篇回答。
然后复制、粘贴、截图……
搞半天,脑子里最后只剩几个零散印象。
现在可以换个玩法。
直接让 MediaCrawler 去搜:
AI Agent
Claude Code
Cursor
OpenClaw
DeepSeek
把相关帖子和评论整理出来。
然后全部交给 AI。
再问它:
最近大家反复讨论什么?
吐槽最多的问题是什么?
哪些需求出现频率最高?
哪些产品开始被频繁提到?
普通用户真正愿意为什么付钱?
哪些观点只是在互相复制?
哪些叙事正在明显升温?
这时候 AI 的回答就完全不一样了。
因为它不是坐在那里“猜网友怎么想”。
它是在读真实网友说过什么。
这个区别很大。
我做美股、Crypto,其实也会想到很多玩法。
比如突然有一个项目开始火。
我不一定只看价格。
还可以看看:
微博有没有明显升温?
B站相关视频是不是突然变多?
知乎开始有人写长文了吗?
评论区是在 FOMO,还是已经开始质疑?
过去 7 天,哪些词的出现频率明显增加?
甚至可以把不同时间段的数据放在一起,让 AI 比:
叙事到底是在扩散,还是已经开始退潮。
这就开始有点“自己的市场情绪数据库”的意思了。
做内容的人也一样。
假如你准备做一个:
普通人为什么不用 AI Agent?
别先让 ChatGPT 给你列 10 个痛点。
先抓 1000 条真实评论。
然后让它帮你归类:
不会安装
太贵
不知道有什么用
隐私担忧
操作太复杂
效果不稳定
……
再从真实用户的问题里面找选题。
这种内容通常比:
帮我想 20 个爆款选题
靠谱得多。
上手其实也不算复杂。
先拉项目:
git clone
进入目录:
cd MediaCrawler
同步环境:
uv sync
然后就可以开始跑。
比如搜小红书:
uv run --platform xhs --lt qrcode --type search
第一次按提示登录。
后面设置关键词,就可以开始采集。
如果你不喜欢折腾命令行,它也有 WebUI。
平台、登录方式、采集方式、参数这些都可以直接选。
数据最后可以存成:
CSV
JSON
JSONL
Excel
SQLite
MySQL
如果只是自己研究,我建议别搞复杂。
CSV / SQLite 先跑起来就够了。
我觉得这个项目真正有意思的地方,不是“又多了一个爬虫”。
而是它刚好能补 AI 现在一个很大的短板:AI 很会分析。
但前提是,你得先给它值得分析的数据。
以后我的研究流程可能越来越像这样:
公开内容
↓
MediaCrawler 把数据搬回来
↓
AI 清洗 / 分类 / 总结
↓
找情绪、痛点、趋势、异常信号
↓
人自己做判断
说白了:
爬虫负责搬。
AI 负责读。
人负责判断。
三件事分开以后,比直接打开 ChatGPT 问一句:
“最近市场都在关注什么?”
靠谱太多。
仓库:
做 AI、Crypto、内容、产品研究的,可以收一下。
当然,这类工具只建议用于合规的公开信息研究,控制采集频率,遵守平台规则,也别碰隐私数据。
最后送一句我最近越来越认同的话:
别只想着让 AI 上网找答案。
真正值钱的,是开始给 AI 建自己的数据源。
顯示更多