註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 DeepResearch
DeepResearch 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 DeepResearch 的搜尋結果
搞了个查东西的agent,这玩意实在是太慢了啊… 虽然质量还行,好像比gpt deepresearch的质量还要好一点
传统的 Deep Research 已经卷到头了。 能写出一份漂亮的总结报告 ≠ 能把真实的复杂任务干完。 我拿几十万字的《红楼梦》原著,给 Apodex 1.1 在线工作台,出了个极其变态的任务。 统计 20 个核心人物的 → 出场次数 → 出场回数 → 每个人第一次出场时的原句 最后还要整理成一张可以直接下载的完整表格。 整个完成任务的过程,像是直接「雇佣一个 AI 数据团队」。 上传文件后,它自己开始拆任务。 一个 Agent 负责解析原著,另一个独立分析,多个任务并行推进; 右侧 Task Board 会实时告诉你现在做到哪一步。 更有意思的是,任务跑到一半,我突然改需求: “只分析前 80 回,后面的不要了。” 以前遇到这种情况,AI 很可能重新来一遍。 Apodex 直接保留已经完成的成果,只重规划受影响的部分。 更关键的是,它不是做完就交卷。 交付前,又调起独立核验 Agent,把人物统计、出场回数和 900+ 条出场原句重新检查一遍。 最后交付给我的是: 可下载的结构化表格 + 完整分析结果 + 口径说明。 这可能才是下一代 Deep Research 真正值得关注的变化: 从“帮你生成一份报告”,变成“接管一项复杂任务,并把它做完”。 目前,Apodex 1.1 Web 端已经正式上线。 🎁 注册即送 credits,强烈建议立刻上传个复杂文件自己跑跑看: 🌐 没想到,更炸裂的是,Apodex 居然开源了 开源模型: Apodex 1.1 mini,35B,开放模型权重,支持本地部署。 开源框架: FrontierAgent,Agent 执行 Harness,支持 ReAct 单 Agent + Multi-Agent Team。 本地运行: 支持 macOS / Linux,无需强制依赖 Docker。 组合能力: Apodex 1.1 mini + FrontierAgent,可在本地运行完整 Agent 执行流程。 💻 如果你是开发者,这里有开源 Agent 框架,欢迎顺手点个 ⭐: 👉 🤗 想本地自己跑模型的看这里👇 #Apodex# #DeepResearch#
顯示更多
0
129
127
35
轉發到社區
冷知识,RAG 技术的演进路径 ① 2020 — 基础 RAG(解决"知识不在模型里") 起点是 Lewis 等人的 RAG:DPR 稠密检索 + 向量相似度 + 生成。它第一次让 LLM 能"外接知识库",缓解幻觉和时效性问题。但这代是"无脑检索"——先把所有文本切成 chunk 做向量索引,查询时取 top-k 就完事。痛点:chunk 彼此孤立、检索粗糙、对复杂问题无力。这正是所有分支要解决的问题。 ② 2022–2023 — 检索精度升级(更准) ColBERTv2:把"单向量"改成 token 级多向量 + MaxSim 延迟交互,匹配更细;残差压缩把存储降 6–10 倍。检索器本身从"粗"变"准"。 Modular RAG:意识到 RAG 不该是固定管道,而是一堆可编排模块(检索/重排/生成),像乐高一样组合。架构开始"模块化"。 ③ 2023–2024 — 反思纠偏 + 结构增强(更准、更懂关系) Self-RAG / CRAG:给系统装"质检员"——Self-RAG 用反思 token 自己决定要不要检索、内容对不对;CRAG 用轻量评估器三路径纠正(正确用/错误重写或联网/模糊混合)。解决了"检索到垃圾也不知道"的问题。 RAPTOR:用递归摘要树组织文档,适合全局性、多跳、总结类问题。 GraphRAG / LightRAG / HippoRAG2:把文本抽成实体–关系知识图谱,用图谱做多跳推理(Microsoft GraphRAG 用 Leiden 社区摘要;HippoRAG 用个性化 PageRank)。这是"结构化知识"路线,但全量图谱构建很贵。 ④ 2024–2025 — 路由与成本优化(更省) Adaptive RAG:按查询复杂度动态路由——简单问题直接 LLM 答、复杂问题才走多步检索。 LazyGraphRAG:把社区摘要延迟到查询时才算,索引成本降到 GraphRAG 的 0.1%。 长上下文路由:2M token 窗口出现后,结论是"不替代 RAG,而是分工"——简单查走 RAG(几分钱),复杂多跳走长上下文,视觉文档走 ColPali。GraphRAG-Bench(ICLR 2026)给出经验法则:图的价值随查询复杂度上升。 ⑤ 2025–2026 — 自主智能体 + 强化学习(更自主) Agentic RAG:让 AI agent 动态决定"用什么工具(向量库/网页/API/SQL)、查几轮、怎么合成"。 Search-R1 / DeepRetrieval / DeepResearcher / MCTS-RAG:用 RL 端到端训练 LLM 学会"何时搜、搜什么"。Search-R1 在 Qwen2.5-7B 上比普通 RAG 提升 41%;DeepRetrieval 直接以检索指标(recall@k、NDCG)为奖励优化查询;MCTS-RAG 把蒙特卡洛树搜索融进推理。这是从"固定流程"走向"会自己找信息的智能体"。
顯示更多
0
37
101
20
轉發到社區
分享一下2026我最常用的AI产品。 自去年8月之后,时间又过了大半年,我觉得我又可以来分享一下我现在最常用的AI产品了。 AI圈的变化,实在是太快了。 毕竟,马上五一假期了。 我相信很多朋友肯定不出去玩,要在家里学AI的对吧?肯定的吧! 所以咧,出一期这个,也能帮大家,在五一假期学习AI。 坦诚的讲,我用的大部分都是海外版的产品,因为从能力和质量上来说,目前海外版的一些产品确实能力更强,但也更贵。 但考虑到很多人的不方便,所以如果国内有水平差不多的,我也会推荐一个国内的产品,方便大家使用,如果某项能力差很多的,我就不推荐了。 那么,咱们开始。 1. 知识问答: GPT-5.5(幻觉极低) 豆包(国内) 2. 内容创作与知识管理: Claude Opus 4.6(独一档的夯,别用Opus 4.7,真的拉) DeepSeek V4 Pro(国内) 3. 数据分析: Codex + GPT-5.5 Claude Code + GLM-5.1(国内) 4. 前端设计: Gemini 3.1 Pro Kimi K2.6(国内) 5. 架构规划: Claude Code + Claude Opus 4.7 Claude Code + GLM-5.1(国内) 6. 代码开发执行: Codex + GPT-5.5 Claude Code + GLM-5.1(国内) PS:我现在一般是cc + Opus 4.7做完规划以后,Codex + GPT-5.5去进行详细开发和执行。 7. 深度研究: ChatGPT DeepResearch 豆包(国内) 8. 图片与平面设计: GPT-image-2(独一档的夯) 即梦Seedream-5.0-lite(国内) 9. 视频生成与编辑: Seedance 2.0(运动质感) 可灵3.0(电影质感,原生4k夯爆了) PS:两个都是国内的。 10. 音乐生成: Suno v5.5 MiniMax Music 2.6(国内) 11. 3D生成: TripoAI 12:AI输入法: 豆包输入法(语音输入夯爆了) 13:AI硬件: 飞书录音豆(帮我拿我自己每天的语音对话Context进飞书会议纪要) GetSeed录音卡(帮我每天发芽获得新的认知) 14:AI热点资讯获取: AIHOT(我自己做的,浓缩了三年做AI自媒体的经验,五一我在家里再优化一下成本和服务器还有安全啥的,预计五一节后可以给所有人免费开放使用,做都做了,不如给大家一起玩) 感觉我几乎常用的就这些了,有点想不起来别的了。。。 如果大家有自己想知道的其他场景的好用的AI产品,也可以在评论区提问,玩了这么多,知无不言。 大概就是这样。 大家五一快乐! 如果没啥大热点的话,那咱们节后再见啦!
顯示更多
0
78
525
90
轉發到社區
最近发现 Gemini 的 Deep Research 很好用。Grok 的 Deep Research 更像是梦到什么说什么,很多东西前后矛盾。ChatGPT 的“报告味”太浓,很多废话。
以为 OpenAI 那种高门槛的 Deep Research 离普通人很远?LangChain 官方直接把底裤都给扒出来了。 LangChain 开源的 open_deep_research,说白了就是完全开源复刻了顶尖 AI 机构的“深度研报生成引擎”。基于 LangGraph 构建,采用了 Supervisor + Sub-Agent 的多智能体协作架构(MIT 协议)。不管你是接 OpenAI、Claude 还是挂 DeepSeek,几分钟就能在本地搭出一个能自主拆解课题、多线程联网搜资料、自动交叉验证并生成长篇研报的 AI 代理系统。 需求主动澄清:课题太模糊它不上杠,先提问把你需求搞明白再动手 任务并行拆解:主智能体切分子课题,派多个子 Agent 独立去抓资料 智能体开发者社区 - CSDN 上下文防暴击:子 Agent 自动清洗垃圾网页,只向上汇报高密度信息 模型自由切换:想省钱直接用开源大模型,不用被单一厂商绑定 GitHub:
顯示更多
✨ 更新速览 | Gate AI 两大新功能上线 ✅ Deep Research 新增指定网址深度研究,输入项目官网、区块浏览器链接或合约地址,即可开展精准深度调研 ✅ 原本受 VIP 等级限制的市场异动通知现已面向全体用户开放,第一时间掌握全网市场动态 高效赋能链上研究与市场决策,快来体验 👉
顯示更多
@jinglian 这不是问答了,是项目管理! 传统 Deep Research 卷的是“把报告写好看”。 这个 demo 卷的是“把活干完”。 中途砍到前 80 回还不重开,最后还交出可下载表 + 口径说明 + 核验记录。
顯示更多
我现在的内容搜集和学习路径已经变了 想写个 MCP 的教程和介绍 直接 Gemini Deep Research 搜索整理成文档 然后再用我的提示词变成可视化页面辅助阅读和理解,知识消化速度大幅提升 里面的可视化内容还能在写文档的时候当配图
顯示更多
0
21
554
112
轉發到社區
Jason Wei 在 Stanford AI Club 做了一场约 30 分钟的演讲,围绕三个他认为理解 2025 年 AI 格局最基本的思维框架展开。Jason Wei 目前在 Meta Superintelligence Labs 做研究,此前在 OpenAI 参与创建了 o1 和 Deep Research,更早在 Google Brain 推动了 chain-of-thought prompting 和 instruction tuning 的研究,累计被引超过 9 万次。 一、智能正在变成大宗商品 他把 AI 的进步分成两个阶段:第一阶段是推前沿,模型还做不好某件事,你在解锁新能力;第二阶段是一旦能力达成,它就会迅速被商品化。用 MMLU 基准测试的数据看,每一年达到同等智能水平所需的花费都在下降,这个趋势在他看来还会持续,核心原因是深度学习历史上第一次"自适应计算"真正跑通了。过去不管问题多简单多难,推理用的算力是固定的;现在从 o1 开始,模型可以根据问题难度动态调整推理时的算力投入,这意味着简单任务的成本可以被压到极低。 另一个维度是获取公开信息的时间。他画了一条时间线:从前互联网时代到互联网时代、聊天机器人时代、再到 AI 智能体时代,找到一条信息所需的时间在指数级缩短。他举了一个例子——"1983 年韩国釜山有多少对夫妇结婚?"——o3 回答不了这个问题,但 OpenAI Operator 可以,因为它能打开韩国统计数据库 KOSIS,一路点击操作直到查到答案。OpenAI 内部用一个叫 BrowseComp 的基准来衡量这种"知道答案就秒验证,但找答案极耗时"的任务,人类平均每题花两小时以上,很多题根本做不出来,而 Deep Research 能解决大约一半。 这个趋势带来几个推论:过去靠知识门槛建立壁垒的领域会被民主化,vibe coding 和个人健康管理是典型例子;公开信息近乎免费之后,私有内部信息的相对价值反而上升了——比如你知道哪些房子没上市但可以卖,这种信息会更值钱;最终每个人将拥有一个"个性化互联网",想知道什么就有一个为你定制的页面呈现给你。 二、验证者定律:能衡量的就能被 AI 攻克 第二个框架是他所说的"验证不对称性"。有些任务,生成一个解比验证一个解难得多——数独是经典例子,写出能跑 Twitter 的代码需要大量工程师,但验证它能不能用只要打开网页点几下。另一些任务则相反:写一篇看起来有道理的事实性文章很快,但逐句核实极其费时;宣称"最好的饮食是只吃野牛肉"只花 10 秒,但验证这个说法需要大样本和长期跟踪。 他在一个二维平面上把这些任务画出来:X 轴是生成难度,Y 轴是验证难度。关键洞察是,你可以通过提供"特权信息"来改变任务在这个平面上的位置——竞赛数学题如果给了答案就秒验证,写代码如果给了测试用例(像 SWE-bench 那样)验证也变得简单。 由此他提出了 Verifier's Law:AI 训练出来在某个任务上的能力,基本上与该任务的可验证程度成正比。具体来说,可验证性取决于五个因素:是否有客观正确答案、验证速度多快、能否大规模并行验证、噪声大不大、以及奖励信号是连续的还是二元的。几乎所有 AI benchmark 本身就是因为容易验证才被设计出来的,而这些 benchmark 确实在过去几年被逐一攻破,这恰好是 Verifier's Law 的实例。 他特别推荐了 DeepMind 的 AlphaEvolve 作为利用验证不对称性的范例。AlphaEvolve 挑选满足上述五个条件的问题——比如找到 11 个六边形的最优排列使外接六边形最小——然后用大语言模型采样大量候选解,自动评分,把最优解作为下一轮采样的灵感,不断迭代。关键技巧在于它绕过了泛化问题:训练集和测试集是同一道题,你就是想知道这一道题的最优解。 这个框架的实际推论是:最先被自动化的任务一定是验证成本最低的任务;而一个正在崛起的创业方向是——发明新的衡量方法,把原本难以验证的任务变得可验证,从而让 AI 去优化它。 三、智能的锯齿状边缘 对于"AI 将如何改变世界"这个问题,他看到的观点光谱极广。他的一个量化交易员朋友觉得 ChatGPT 跟自己工作无关,而他在顶级实验室的同事则认为再过两三年 AI 就会取代他们自己的工作。 他明确反对"快速起飞"假说——即一旦 AI 跨过某个临界点就会突然变成超级智能。他的理由是,AI 的自我改进不是一个二元开关,而是一个渐进光谱:从跑不起来代码,到能训练但结果一般,到能自主训练但不如顶尖研究者,再到偶尔还需要人工干预。更重要的是,自我改进的速度应该按任务来看。AI 的能力图谱是一条锯齿线:在某些任务上已经达到山峰(竞赛数学、部分编程),但在另一些任务上仍是低谷(比如 ChatGPT 曾长期认为 9.11 大于 9.9,或者说一门只有几百人会的原住民语言 Tlingit)。 他给出了判断 AI 在某个任务上进步速度的三条启发式规则。第一,AI 擅长数字化任务,核心原因是迭代速度——数字环境可以轻松扩展算力,而物理机器人的实验扩展成本高得多。第二,人类觉得容易的任务 AI 也往往容易,但有一类例外是"人类因生理限制做不到但 AI 可以做到"的任务,比如读过一千万张乳腺影像后发现某个人类注意力无法捕捉的模式来预测乳腺癌。第三,数据充足的任务 AI 表现好——数学推理在不同语言上的表现和该语言的训练数据量高度相关;而如果一个任务有单一客观指标,就可以通过强化学习生成合成数据来突破数据瓶颈,AlphaEvolve 和 AlphaZero 都是这个路线。 他用一张表把这些启发式规则应用到具体任务上:主流语言翻译已经完成;调试基础代码 2023 年搞定;竞赛数学 2024 年搞定;AI 研究本身大概 2027 年;化学研究因为不是纯数字任务会更晚;拍电影大概 2029 年;修水管和理发因为高度物理化,短期内不太可能;乌兹别克传统地毯编织需要一组人花一个月、非数字化且缺数据,AI 不太可能碰到;至于"带女朋友约会让她满意"——他的判断是"impossible,非数字化,缺数据",人类还能保住饭碗。
顯示更多