注册并分享邀请链接,可获得视频播放与邀请奖励。

搜索结果 LangSmith
LangSmith 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含 LangSmith 的推特
🧠 LangChain 官方开源的这套教程,是我见过把 agent 讲得最不玄的一份。 2k star,从零手写一个能真正接管你 Gmail 的邮件助手。 现在讲 agent 的教程有个通病:跑通一个 demo 就结束了,你照着敲完能出结果,但换个场景照样不会写。因为真正难的部分它都跳过了——怎么评估好坏、怎么让人在关键动作前审一道、怎么让它记住你的偏好。 这套教程反过来,就是围着这四块走:先搭基础版邮件助手,做分类加回复;再用 LangSmith 和 Pytest 做评估,让大模型当评审去打分;然后加人工介入,发邮件和约会议这类动作先弹给你确认再执行;最后接上记忆,让它根据你每次的修改自动调整偏好。每一部分都配 Notebook,代码全在仓库里。 练手阶段用模拟的邮件和日历工具,学完直接换成 Gmail API,就是一个天天在跑的东西。 会跑 demo 和会做产品之间,差的就是这四步。 GitHub:
显示更多
0
3
193
48
转发到社区
推荐这篇文章。一个 agent 评测系统被自己的评分骗了整整一周——两个标准在互相拉扯,总分却看起来正常。 Similarweb 的高级 AI 工程师 Liora Korni 在 7 月 29 日 LangChain 博客上分享了一篇实战文章:如何评估一个生成长篇研究报告的 agent 系统。文章的价值不在方法论本身——LLM-as-judge 和 rubric 都不是新概念——而在他们把评估当作产品架构的一部分来做的具体教训。 两种输出,两种评估方式 Similarweb Data Studio 是一个 agent 系统:用户用自然语言提问,agent 规划、调用数据工具、检索数字、写出答案。它要处理两类完全不同的输出: 普通对话:聚焦问题,答案形状可预期。评估方法简单——golden answer + semantic judge 判断"是否表达了同样的意思"。 深度研究报告:长文输出,包含来源、解读、建议、风险提示和叙事结构。同一问题可能有多种好的答案。Golden answer 不适用——匹配 gold answer 只会奖励相似性而不是质量。 Rubric 方案 深度研究报告的评估用 rubric prompts:每个质量维度有自己的评分锚点。例如 source_integration 标准: • 0.0:纯粹依赖单一数据 API,无外部上下文 • 0.3:模糊引用"行业报告"但不点名 • 0.8:引用多个带名称、日期、数字的来源 • 1.0:广泛使用归因明确、融入叙事的来源 每个维度返回分数 + 解释 + 差距说明。不只是一个数字。 除此之外还加了 faithfulness check:每个声明是否真的来自检索数据?还是 agent 夸大了来源支持的内容? 最贵的教训:花了整整一周跟自己的评估打架 文章里最值得读的部分:一次 prompt 的小改动让总体评分下降。 他们花了一周反复 revert、调整、re-run。报告每次看起来都很好,但数一直在说不。最后有人打开逐标准评论才发现——新版报告引用了更多来源(提高了 source breadth),但这些来源都是模糊的(拉低了 attribution)。两个标准互相拉扯,总分隐藏了冲突。 修复了评分锚点后(从"引用更多来源"改为"引用命名、可验证的来源"),同一个报告的分数从 0.7 降到了 0.3,数值终于匹配了评论一直在说的东西。 核心教训:一个校准错误的评估比没有评估更糟糕,因为它给你虚假的信心。 最终的评估循环 1. 从假设开始 2. 跑一个小评估获取信号 3. 检查反馈评论和 traces 4. 跑完整 benchmark 并重复 5. 与 baseline 或 A/B 输出对比 6. 决定合并、迭代还是重新校准 原文: #AgentEvaluation# #LLMasJudge# #LangSmith#
显示更多
每次搭 AI 应用,都从零开始连模型、接工具、写 prompt、处理输出……等真的能跑,已经过去半天了。 LangChain 解决的就是这个问题。它把所有重复动作封装成标准组件——模型、嵌入、向量库、工具调用——然后让你像搭积木一样拼起来。 核心价值不是“能做什么”,而是“不用反复重写”。换模型?改一行配置。换数据源?换一个组件。把 AI 应用开发从“写代码”变成“拼积木”。 快速开始: uv add langchain from import init_chat_model model = init_chat_model("openai:gpt-5.5") result = model.invoke("Hello, world!") 它自己已经演化成一个生态:Deep Agents(高级 Agent 套件)、LangGraph(可控 Agent 工作流)、LangSmith(调试和评估)、LangSmith Deployment(部署和扩展)。 如果你正在做 AI 应用,LangChain 大概率是那个“省下 80% 重复劳动”的基础层。 开源,仓库: 适合三类人: 1. 刚开始做 AI 应用、想快速出原型的开发者 2. 需要频繁换模型、接不同数据源的技术团队 3. 想建 Agent 系统但不想从零写编排的人 收藏备用,下一个 AI 项目从它开始。
显示更多