註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

檢索結果 成本基准
成本基准 貼吧
一個關鍵字就是一個貼吧,路徑全站唯一。
建立貼吧
用戶
未找到
包含 成本基准 的搜尋結果
把一千篇真实论文丢给三个模型做摘要,同一份语料、同一份 prompt:DeepSeek 的 Flash 跑完全部只花 $3.99,Claude 的 Haiku 花了 $35.76。 《年度 AI 论文:2025–2026 年的关键研究》 一年 1,000 篇论文的图鉴,外加一个成本实验。 是 Hassan El Mghari(GitHub 上的 Nutlope,Together AI 生态的知名开源开发者,做过 roomGPT、SmartPDFs 等热门项目)做的「年度 AI 论文」站点:2025 年 8 月 4 日到 2026 年 8 月 4 日这一年的 1,000 篇论文,每篇都有摘要,可按实验室、主题、月份浏览。整个项目的起点其实是个成本实验:把这一年的论文全部摘要完,要花多少钱? 基准结论:同一份输入,三个模型差了 8.95 倍。 语料合计 30,681 页、1.027 亿字符。三个模型拿到完全相同的提取文本、prompt、分块方式和输出合同,关闭 reasoning,各跑一遍: • DeepSeek V4 Flash:合计 $3.99,每篇约 $0.004 • GPT-5.6 Luna:合计 $6.00,每篇约 $0.006 • Claude Haiku 4.5:合计 $35.76,每篇约 $0.036(8.95×) 费用按官方报价的 token 用量计算,价格冻结在 2026 年 8 月 5 日;只统计成功完成的摘要,失败重跑不计入。 方法论可复现。 语料从 8,262 个候选(Hugging Face Daily Papers + OpenAI、Anthropic、DeepSeek、MiniMax、Moonshot AI 的官方论文)按 arXiv ID 去重,冻结成恰好 1,000 篇;放得进上下文预算的整篇一次读完,超长的走 50,000 字符的 map-reduce,不静默截断。作者明确说这是成本对比,不是质量排名——没有引入 LLM judge 打分。 图鉴本身也好看。 按实验室(OpenAI、Anthropic、Moonshot AI、DeepSeek、MiniMax、 275 篇、Reasoning 177 篇、Video 164 篇、Multimodal 144 篇、Systems 143 篇、Robotics 59 篇)、月份浏览;trending 和 most cited 两个榜单(Qwen3-VL 1,802 次引用、DINOv3 1,216 次、InternVL3.5 1,212 次)。再叠上 18 篇 Together AI 官方论文,共 1,018 篇。 适合想快速补完这一年 AI 研究的人,以及要批量处理 PDF 摘要、想先估成本的工程团队。全流程开源在 GitHub(Nutlope/1kpapers),语料清单、抽取画像、逐篇费用都能自己复现。 原文: #AI论文# #成本基准# #LLM#
顯示更多
AWS 资深专家解决方案架构师 Daniel Abib 在官方博客里算了一笔账:同步调用时,Lambda 的计费时长几乎等于 agent 思考的时长,等待本身在按全量计算计费。 《在无服务器流水线中异步调用 Amazon Bedrock AgentCore agent 的模式》 在无服务器流水线里异步调用 Amazon Bedrock AgentCore agent,可以消除你的 AI agent 处理请求期间的空转计算成本。一个常见的例子是文档校验:在房地产融资的后台办公室里,agent 可以读取房产记录或贷款合同,推理信息是否完整、一致,然后返回一个下游步骤据此行动的结论。Amazon Bedrock AgentCore 提供了一个平台,让你能用任意框架或模型大规模地构建、连接和优化 agent。 这类 agent 带来一个传统流水线步骤没有的特性:它们在回答之前要思考一会儿。思考多久取决于提示词、模型和文档,但很少是即时的,而这个延迟改变了你调用它的方式。最常见的首版实现是用一个计算服务(比如 AWS Lambda 函数)调用 agent 并等待响应。函数等待期间什么都不做,但它仍在运行,每一秒都在计费。 值得看清成本到底落在哪里,因为调用的两侧计费方式不同。Amazon Bedrock AgentCore runtime(Amazon Bedrock AgentCore 的一项能力)采用基于消耗的计费模型,agent 空闲时不收 CPU 费用。例如,在等待大语言模型生成响应、或等待工具或 Model Context Protocol(MCP)调用返回的这段时间里,你只按内存计费,不按 CPU 计费。调用 agent 的那个计算服务没有这种特性。发出同步调用的 Lambda 函数、容器或 Amazon EC2 实例会一直阻塞,在 agent 响应之前始终持有(并支付)完整的计算配额。所以浪费不在 agent 一侧,而在调用方——它挂在一个打开的连接上空转。 这就让调用方的成本跟着 agent 的运行时间走。阻塞在 agent 上的函数,计费时长几乎等于整个处理时间;而启动 agent 后立即返回的函数,只按短暂的派发计费。解法是在等待期间释放调用方的计算资源,等 agent 出了结果再恢复流水线。本文展示三种做到这一点的模式(task-token 回调、直接服务集成、durable function),并与阻塞式反模式对比。 示例流水线 为了让各模式在同等条件下比较,我们把每个模式都跑在同一条流水线上,只更换调用 agent 的那一步。这条流水线是一个刻意简单、虚构的场景(房地产融资文档校验),选它只是为了把编排讲清楚。它不是本文的重点,它代表任何先调用 agent(或其他慢服务)、再对结果采取行动的流程,你可以把自家用例代入。 流水线有五个阶段: 1. Extract:一个 Lambda 函数对文档做 OCR 和文本提取。(提取是模拟的,所以场景不需要真实文档。) 2. Identify:一个 Lambda 函数对文档分类并设置路由标志(shouldOrganize、shouldValidate)。 3. Route:一个 Choice 状态根据这些标志决定流程走向。 4. Organize and Validate:一个 Parallel 状态在组织文档的同时,让 Amazon Bedrock AgentCore agent 在另一个分支里做校验。这个 Validate 分支是各模式之间唯一变化的部分。 5. Result:一个 Lambda 函数处理 agent 的结论,决定下一步动作(批准,或退回修改)。 图示如下:水平流程依次是 Start、Extract、Identify、Route(Choice)、并行的 Organize-and-Validate 阶段、Result、End,Validate 分支被标为可更换,图例列出了它的四种实现方式:阻塞反模式、模式 1(task token)、模式 2(直接集成)、模式 3(durable function)。流水线本身在每种情况下保持不变,只有 Validate 分支被换掉来演示各自的调用模式。 同一个 Amazon Bedrock AgentCore agent 服务全部四种情况。agent 检查每次调用并选择如何响应:如果收到 AWS Step Functions 的 task token,就在完成时唤醒那个执行;如果收到 durable function 的 callback ID,就唤醒那个 durable function;两者都没收到,就直接在响应里返回结论。这意味着你可以更换编排模式,而不必修改或重新部署 agent。 agent 如何不阻塞调用方就把控制权交回来 机制是 agent 的 action group 里的一个"归还控制权"动作。agent 推理结束后,调用一个 Lambda,把结果和 task token 发回 Step Functions。(后面的模式 2 会让 Step Functions 直接与 AgentCore 集成,完全省掉这个 Lambda。) 下面这段代码是这个 Lambda 的核心: The tool the agent calls once it reaches a verdict @tool def conclude_validation(approved: bool, issues: list, summary: str) -> str: verdict = {"approved": approved, "issues": issues, "summary": summary, "source": "agentcore"} # A Step Functions task token was passed: resume that execution if task_token: sfn.send_task_success(taskToken=task_token, output=json.dumps(verdict)) return "Step Functions resumed." # A durable-function callback ID was passed: resume the durable function if callback_id: lambda_client.send_durable_execution_callback_success( CallbackId=callback_id, Result=json.dumps(verdict).encode("utf-8")) return "Durable function resumed." # Neither was passed: this is a synchronous call, return the verdict inline return "Verdict recorded." 入口函数根据同样的信号决定在后台跑还是同步跑: @app.async_task async def validate_document_async(prompt, document, extracted_text): # Background work; conclude_validation fires the right callback when done agent = build_agent() await agent.invoke_async(message(prompt, document, extracted_text)) @app.entrypoint async def handler(event): task_token = event.get("taskToken") # passed by the task-token pattern callback_id = event.get("callbackId") # passed by the durable-function pattern # Asynchronous: start the work and return "accepted" right away if task_token or callback_id: asyncio.create_task(validate_document_async(...)) return {"status": "accepted"} # Synchronous: run now and return the verdict in the response agent = build_agent() await agent.invoke_async(message(...)) return verdict agent 就位之后,本文剩下的部分聚焦于调用它的四种方式。代码和基础设施定义都是示例中的摘录,用来演示每种模式。 调用 agent:四种方式 先讲阻塞式反模式以确立基准成本,再展示避开它的三个模式。 阻塞式反模式 最直接的实现:在同一个 Lambda 函数里调用 agent 并等待答案。它能用,而且实现简单——这正是它如此常见的原因——但函数在 agent 思考的整个期间一直活着。 // The Lambda function blocks here until the agent responds const response = await agentcore.send( new InvokeAgentRuntimeCommand({ agentRuntimeArn: AGENT_RUNTIME_ARN, payload: new TextEncoder().encode(JSON.stringify(payload)), runtimeSessionId: sessionId, }) ); // The function stays alive and billed for the entire time the agent is thinking. 函数的计费时长最终大约等于 agent 的处理时间。后面三个模式消除这段空闲成本,各自做出不同的取舍。特别是模式 2 使用 Step Functions 对 AgentCore Harness (InvokeHarness) 的优化集成,完全去掉 Lambda。 模式 1:task-token 回调 + 派发函数 这个模式在路径里保留一个 Lambda 做自定义逻辑,但去掉空闲成本。Step Functions 用 waitForTaskToken 集成调用这个函数——传入一个 task token 后暂停执行。函数用这个 token 启动 agent,然后在几秒内返回。执行保持暂停,不产生任何计算计费,直到 agent 用这个 token 调用 SendTaskSuccess 恢复它。 // Start the agent, pass the task token, and return without waiting const response = await agentcore.send( new InvokeAgentRuntimeCommand({ agentRuntimeArn: AGENT_RUNTIME_ARN, payload: new TextEncoder().encode(JSON.stringify({ ...payload, taskToken })), runtimeSessionId: sessionId, }) ); // Returning here does not complete the step. Step Functions stays paused until // the agent calls SendTaskSuccess with this task token. return { dispatched: true }; 对应的状态从上下文取出 token,并设置超时和心跳作为安全网——这样沉默的 agent 会让执行干净地失败,而不是无限期停在那里: "ValidateDispatch": { "Type": "Task", "Resource": "arn:aws:states:::lambda:invoke.waitForTaskToken", "Parameters": { "FunctionName": "${ValidateDispatcherFunctionArn}", "Payload": { "taskToken.$": "$$.Task.Token", "document.$": "$.document", "extractedText.$": "$.extract.extractedText", "executionId.$": "$$.Execution.Id" } }, "TimeoutSeconds": 120, "HeartbeatSeconds": 60, "Next": "AgentCoreValidation" } 成本。 Lambda 函数仍然会跑,但只跑到启动 agent 并返回为止:几秒钟,无论 agent 之后要跑多久。你只为这次短暂派发付费,不为等待付费——因为函数在 agent 干活时已经关掉了。等待由暂停的 Step Functions 执行承担,它不为空闲计算计费。这是与阻塞版本的关键区别:阻塞版本里函数的计费时间跟着 agent 的处理时间走。 模式 2:直接服务集成 当你不需要围绕 agent 调用写自定义代码时,可以去掉派发函数,让 Lambda 完全离开路径。Step Functions 可以通过 AWS SDK 服务集成直接调用 Amazon Bedrock AgentCore,所以 agent 的响应直接流入下一个状态。Validate 分支于是变成单个 Task 状态: "ValidateDirect": { "Type": "Task", "Resource": "arn:aws:states:::aws-sdk:bedrockagentcore:invokeAgentRuntime", "Parameters": { "AgentRuntimeArn": "${AgentRuntimeArn}", "RuntimeSessionId.$": "States.Hash($$.Execution.Id, 'SHA-256')", "Payload.$": "States.JsonToString($.prep.agentInput)" }, "ResultSelector": { "raw.$": "$.Response" }, "TimeoutSeconds": 120, "Next": "ParseVerdict" } 成本。 路径里没有 Lambda,所以没有空闲的 Lambda 计算可付。Step Functions 承担等待,Standard 工作流按状态转换计费而不是按等待时长计费——处理期间的实质成本只有 agent 本身。 模式 3:Lambda durable function 如果你更愿意用代码而不是状态机来表达编排,Lambda durable function 给你同样的成本行为。用 @aws/durable-execution-sdk-js SDK,流水线阶段变成 context.step 调用,并行工作变成 context.parallel,等待 agent 变成 context.waitForCallback。等待期间函数挂起,不计计算费。agent 用 SendDurableExecutionCallbackSuccess 恢复它。 // Suspend the function until the agent calls back const result = await ctx.waitForCallback( "validate-agentcore", async (callbackId) => dispatchAgentCore(callbackId, document, extractedText, executionId), { timeout: { seconds: 120 } } ); 成本。 一个函数承载整条流水线,但挂起等待 agent 期间不按计算计费。你只为挂起之间短暂爆发的那几次执行付费——与 task-token 模式相同的经济性——而不是为等待付费。 测量差异 重点不是某个具体数字。agent 的运行时间随提示词、模型和文档变化。重要的是 task-token 模式里两个值之间的关系:Validate 状态活跃了多久,对比派发函数实际被计费了多久。我们测试中的单次运行让这个关系可见: Step Functions, ValidateDispatch state Returned (TaskSubmitted): 14:08:19 <- the function returned and shut down Resumed (TaskSucceeded): 14:08:34 <- the agent woke the execution State active ........ 19.6s Lambda, dispatcher function (CloudWatch REPORT) Billed duration ..... 4.8s Result: the state was active for 19.6s, but the function was billed for 4.8s. The ~14.8s in between is wait time with no Lambda function running. 在 Step Functions 的事件历史里也能看到同样的事:task-token 模式下,TaskSubmitted 事件(函数返回)与 TaskSucceeded(agent 恢复流程)之间隔着 agent 的处理时间。同步调用没有这样的间隔。 下表总结了每种模式下 Validate 分支(前面图示中高亮的部分)的实现方式: • 编排器:阻塞=Step Functions;模式 1=Step Functions;模式 2=Step Functions;模式 3=Lambda(代码) • 路径中的 Lambda:阻塞=有,存活且计费;模式 1=有,但提前返回;模式 2=无;模式 3=durable function 本身(挂起) • 等待期间的空闲 Lambda 计算:阻塞=为整个等待付费;模式 1=无;模式 2=无;模式 3=无 • agent 调用周围的自定义代码:阻塞=有;模式 1=有;模式 2=有限(状态转换);模式 3=有 • 调用方与 agent 解耦:阻塞=否;模式 1=是;模式 2=否;模式 3=是 • 相对复杂度:阻塞=最低;模式 1=较高(token 和回调的 IAM);模式 2=最低;模式 3=中等(检查点/重放) 读这张表时有一个提醒:总流水线时长不是有用的比较指标,因为它被 agent 自己的推理时间主导——每次运行都不同,而且在所有场景里基本相同。有意义的差异是等待期间你为多少计算付了钱,这由上表和计费时长读数体现。agent 运行时间增长时,派发函数的计费时间保持平稳。上面的数字来自单次运行,把它们当作这个关系的示意而非基准,请测量你自己的负载。 如何选择模式 下表总结了取舍,帮你选择模式: • 调用方成本:阻塞=整个 agent 处理时间;模式 1=几秒(仅派发);模式 2=零(无 Lambda);模式 3=几秒(仅派发) • 集成工作量:阻塞=低;模式 1=中高(IAM、心跳、超时);模式 2=低(单个 Task 状态);模式 3=中等(检查点-重放模型) • 业务逻辑位置:阻塞=在 Lambda(前 + 后);模式 1=在 Lambda(前 + 后);模式 2=只在 Amazon States Language(ASL)(内置函数);模式 3=在 Lambda(顺序代码) • 最适合:阻塞=原型、短 agent;模式 1=自定义前后处理逻辑;模式 2=纯编排、无自定义代码;模式 3=单个函数里的复杂异步工作流 最佳实践 防 agent 永不回答。 给每个 waitForTaskToken 状态设置 TimeoutSeconds,让执行以 States.Timeout 失败,而不是无限期挂起。如果你的 agent 发送心跳,也设置 HeartbeatSeconds 以更快发现死掉的 agent。捕获错误并路由到失败或人工审核路径。 重试时使用稳定的会话 ID。 把 sessionId 设为从执行上下文派生的值(比如 Step Functions 执行名),这样重试会恢复同一个 agent 会话,而不是重新开始。task-token 模式里在派发函数中设置;直接集成模式里在 Task 状态参数中设置。 打开 AWS X-Ray。 在 Step Functions 和 Lambda 配置中启用 Tracing: Active。X-Ray 会精确显示 agent 思考了多久、调用方等待了多久,确认你的模式确实在间隔期间释放了计算。 按速度而不是按 agent 的负载来配派发函数。 派发函数只序列化请求并调用端点。256 MB 内存和 30 秒超时通常就够。重活都在 agent 那边。 成本 这些模式会产生 Lambda 计算、Step Functions 状态转换、durable function 执行存储的费用,以及所有方案共有的 Amazon Bedrock AgentCore runtime 和 Amazon Bedrock 模型推理费用。agent 和模型成本在四种情况下相同。架构只改变编排开销,以及阻塞反模式中浪费的空闲 Lambda 计算。当前价格请查看各服务的定价页。 结论 把 AI agent 放进流水线是简单的部分。让它被经济地调用,才是区分原型与生产设计的地方。阻塞在 agent 上的 Lambda 函数实现简单,却在悄悄烧钱——计费时间里的大部分都在等待。本文展示了三种规避方式:需要在路径里保留 Lambda 时用 task-token 回调;最简单的情况用直接服务集成;偏好用代码表达编排时用 durable function。三者由同一个 Amazon Bedrock AgentCore agent 驱动,它会根据被调用方式调整自己的响应。 完整示例(完整的 agent、状态机定义和 durable function)在 GitHub 的 sample-bedrock-agentcore-async-stepfunctions 仓库。想深入的话,可以看 Amazon Bedrock AgentCore 关于异步任务处理的文档。生产部署请使用 Amazon Bedrock Guardrails,对 agent 的输入输出实施负责任 AI 控制。 原文: #Bedrock# #Serverless# #StepFunctions#
顯示更多
芝加哥商业交易所(CME)正与指数提供商Silicon Data合作,计划推出算力期货市场,目前该项目正等待监管部门批准,该期货产品旨在帮助人工智能开发者、云服务商及金融机构管理算力价格的波动风险。该期货将以Silicon Data编制的指数为基础,该指数为市场参与者提供了衡量构建AI产品或使用图形处理器(GPU)算力成本的参考基准。 来源:Bloomberg
顯示更多
【从现货定价到期货基准:中美算力价格指数与市场机制演进】陈钰什:现货指数和期货产品接连出现,把一个原本分散在企业询价和合同谈判中的问题推到了台前:市场能不能形成一套买卖双方都能使用、可以持续跟踪,并且能够反映未来成本变化的算力价格?
顯示更多
Grok 4.5 High 性价比炸场:性能冲进前三,成本竟只要榜首的十分之一 Cursor AI 正式宣布与 SpaceXAI 合作训练的 Grok 4.5 上线,这是其迄今最强大的模型,并首次将能力从软件工程拓展至更广泛领域。在 CursorBench 基准测试中,Grok 4.5 High 以 66.7% 的综合得分位列第 3,每任务成本仅 $1.51。对比榜首 Fable 5 Max 的 70.5% 得分与高达 $17.32 的单任务成本,Grok 4.5 High 以约十分之一的价格实现了接近顶尖的性能,性价比极为突出。 此外,Grok 4.5 在 Terminal-Bench、SWE-Bench 等核心编码测试中同样表现强劲,直接对标 Opus 4.8、GPT-5.5 和 Fable 5。用户现可在 Cursor 中立即试用,首周享双倍请求额度。需注意,Grok 4.5 与 Composer 2.5 为不同模型类别,后者将继续提供。
顯示更多
网传 GPT 5.6 最新泄露信息: 1⃣GPT 5.6 基准测试表现非常强,据说已经全面超过 Claude Fable 5 2⃣同时调用成本还不到 Claude Fable 5 的三分之一 如果是真的,这波 OpenAI 算是直接掀桌子了🤣
顯示更多
还是很难想象现如今只需要 7-10 个 Claude 账户(以用满每月每周的 Fable 额度为基准),仅一万人民币每月,就可以试探一个人的视角、开发和组织能力边界。 在自己的支付范围内,全力把这个劳动力杠杆开起来吧,没有比这件事更能在现如今称之为“套利”了。 你可以理解为资本市场现在在给当代人广撒空投,20x 套餐实际背后的token成本是可用工作额度(换算为同等劳动力价值)的 n 倍。 曾经创业(or 产品发布)需要花大功夫,甚至需要压上过去10年的积蓄以及未来 10 年的现金流,把一帮合作氛围恰到好处、各自领域的“能力者”拉拢起来,承接各类市场摩擦并且倚靠不稳定的人性构建一个有纪律章法的队伍——这事儿本身试错成本和赌注巨大。 现在你一个人能把绝大部分事情做到 90 分挑不出毛病,不依赖于外部,几乎不损耗现金流,从业结果其实是高度可预测的,高度和你自身挂钩的,“气运”的决定因素衰减。 大量视野广泛并且能对自己决策负责的人会从这个市场里“高度确定地”脱颖而出,没有人能拿“衰”(甚至出身)给自己做解释,必定是自己在担责和开拓能力上出了问题。
顯示更多
0
14
122
10
轉發到社區
尽管中国这个全球第二大经济体公布的第二季度增长数据不及预期,但该国仍维持基准贷款利率不变。 根据中国央行周一发布的数据,一年期贷款市场报价利率(LPR)维持在3.0%,五年期LPR维持在3.5%。这两个利率均已在当前水平保持了一年多。 北京方面近期一直不愿下调传统政策利率,而是通过结构性举措和短期流动性工具来引导融资成本下行并满足流动性需求,例如上月推出了隔夜逆回购操作。 中国央行的数据显示,在信贷需求疲软的情况下,今年上半年中国新发放企业贷款的平均利率较上年同期下降约20个基点,至3%左右;而新发放个人住房贷款利率则稳定在3.1%左右。
顯示更多
中国开源大模型强势崛起:Moonshot Kimi K3(2.8万亿参数)成为全球最大开源权重模型,多基准超越或接近西方前沿模型 Moonshot AI发布的Kimi K3以海量参数和百万token上下文,在编码、推理等任务上表现突出,已登顶部分排行榜(如Arena Frontend Code),引发芯片股波动和行业关注。 中国模型(如Kimi K3、Alibaba Qwen3.8)正通过开源路线挑战美国主导地位,促使美国考虑对外国开源模型实施限制,同时重塑行业对边际成本和推理效率的焦点。
顯示更多
0
13
19
0
轉發到社區