temperature 这个参数,文档里写了半天没人看。
调 0 和调 0.7,你的 RAG 答案能差一个档次。
但大部分人从来不碰默认值,然后怪模型不行。
顯示更多
为什么很多国产模型API的 temperature 不允许自定义了?
是因为蒸馏的原因吗?
📷十二月作品(21日發售)
『魔法聖誕星』127P+2Video/ Dance
“用你的體溫為我解凍,我在平安之夜等你..”
"Thaw me with your body temperature. I'll wait for you on Christmas Eve..."
盒岛:
Subscription:
Fantia購入:
顯示更多
“最近天氣變冷了呢,要試試兔毛的溫度嗎?”
——『雪絨兔』
"The weather has turned cold recently. Do you want to test the temperature of rabbit fur?"
——『Snowfluff Bunny』
顯示更多
读知乎回答有感,浅谈一下后训练 benchmark
Any benchmark will be saturated,而随着工业界后训练的发展,reasoning / coding 的 benchmark 越来越泛化 / 众包化。其实 LLM eval 一直是个草台班子,每家都可以有自己的 setting,而任何 setting 只要不被强行统一就存在操作的空间,最早可以调 temperature / top_p / length,后来可以调 harness / setting。
AA 给出了一个相对“规范”的 setting,让大家都听它的而不是野蛮生长,但这并不 make sense。只要评测非中心化就一定存在 noise,任何结果都可以是 cherry pick 后的,而 AA 官方的 95% 置信度结果就成了 judge 模型能力的标杆。
代价是什么呢?模型如果没有很亮眼的 AA 分数,即使精心打磨体感 / working / CUA,无人在意,这本质也是模型要 sell 就要迎合表面主流的评测中心化组织。
至少我们可以从每家基模厂、每个新模型的发榜看出来大家并不会被 AA 所局限,而 OSWorld v2、ALE、TB4 / TB-Sci 等 frontier 众包 benchmark 已经告诉我们:最 frontier 的能力一定是最通用的能力,而 agent 已经站在了单 domain 能力的肩膀上。
现在的职业任务分为三类,已经被 AI 训练好的,无法被 AI 训练的,还在被 AI 训练的。所有能归纳在 Computer Use 的都是第三类,而模型如何解决第三类职业任务仍需要数年的进化。
这些众包 benchmark 越来越变成第三类任务的闭包,决定了未来数个月内基模团队的优化方向,而越是 frontier 的 benchmark 就越有 noise。如果 benchmark 团队不为自己的错题率负责,只会诞生越来越多的错题 benchmark:GPQA-Diamond,HLE,充斥大街的弱模型 judge。
为了消灭 LLM-judge 所引发的不确定性,众包 benchmark 一定会越来越商业化,而 evaluation 一定会在短暂的时间内迎来大洗盘。
顯示更多
突然发现一个问题,Claude code的模型默认温度竟然是1!!!
在我的认知里,编程这种工作模型的默认温度应该很低啊
于是我去问了问ai,他告诉我现在其实大家已经不怎么关注温度了,低温模型用于代码补齐已经是很久之前的旧“共识”了
现在两个sota都不支持temperature、top_p、top_k这些参数调试了,令人感叹!
顯示更多
一个天气 bot,用一笔 weather bet 把 $28 做成了 +$2,346
不是加密
不是高杠杆
还是天气市场
上个月:
+$13,000
平均每天大概 +$400
几笔代表性交易:
$13 → $4,082
$28 → $2,346
$42 → $1,059
它的策略不是单纯猜最高温
而是:
被低估的 outcome,买 YES
被高估的 outcome,买 NO
例子是这个市场:
“Highest temperature in Seattle on May 6”
它买了:
61–67°F YES,投入 $210
67–73°F NO,投入 $244
模型识别到即将到来的 cold front,所以押在更低温区间
最后 61°F 成为 winning outcome
结果:
YES 赚了 +$2,108
NO 赚了 +$56
这类 bot 有意思的地方在于:
它不是非要猜中一个精确温度
而是用 YES / NO,把正确的温度区间覆盖出来
所以即使胜率只有 47%,只要买到的是被错误定价的 range,整体仍然可以保持正 Expected Value
天气市场真正的 edge,可能不在“预测天气”
而在于:
找到 mispriced ranges,然后用更聪明的方式覆盖它们
顯示更多
Avarok Cybersecurity 开源了 Atlas,一个用 Rust + CUDA 从零写的大模型推理引擎。它不依赖 Python 和 PyTorch,项目方称 Docker 镜像约 2.5GB,冷启动不到 2 分钟,目前主要面向 NVIDIA DGX Spark 的 GB10 平台优化。
官网模型矩阵显示,Atlas 在单台 DGX Spark 上跑 Qwen3.5-35B-A3B 可到约 130 tok/s,跑 Qwen3.6-35B-A3B 约 71 tok/s。Atlas 官网和 Hugging Face 页面称,在同硬件下,Qwen3.5-35B 平均约 111 tok/s、峰值 130 tok/s,vLLM 约 37 至 38 tok/s。
这组「3 倍 vLLM」数据来自项目方公开基准。GitHub README 写明,测试使用的是「法国首都是哪」这类短 prompt,生成上限不超过 30 个 token,temperature 为 0.1。这个口径更接近短请求、低并发、快速响应场景,也正好对应 Atlas 想打的卖点:用更小镜像、更少依赖和更快冷启动,把本地大模型服务变得更轻。
Atlas 现在仍是早期项目,真实生产场景还要看后续长文本、高并发和复杂工具调用测试。GitHub 上已有用户反馈输出质量和工具调用稳定性问题,相关 Issue 截至 2026 年 5 月 11 日仍处于 Open 状态。对开发者来说,它更像一个值得关注的新推理底座,而不是已经能全面替代 vLLM 的成熟方案。
顯示更多
先进封装的”耗材接棒”叙事最近很热,逻辑链也确实成立。但要理解为什么材料战场会从underfill转向CMP slurry,得先搞清楚一个更底层的技术拐点。
Micro bump方案同时撞上了三面墙。第一,bump pitch缩到25μm以下时solder bridging风险飙升,良率断崖。第二,JEDEC对HBM封装高度有硬限制,每层die加上micro bump加上underfill要吃掉40-50μm,堆到16层已经是物理极限,往20层走厚度预算根本不够。第三,underfill的thermal conductivity只有0.2-0.5 W/m·K,铜是401 W/m·K,差了三个数量级。每多堆一层die,中心层的junction temperature就更难控制。三个约束的共同解指向同一件事:取消solder和underfill,让copper直接做diffusion bonding。
Hybrid bonding解决了pitch、高度、散热三个问题,但代价是把容错率压到了atomic level。Micro bump时代表面粗糙度几十纳米就能工作,hybrid bonding要求Ra降到sub-0.5nm,任何一颗纳米级的particle都会在bonding interface形成void,后续thermal cycling会把void扩展成crack。这就是CMP slurry和Cu plating additives变成新咽喉的根本原因,配方质量直接等于bonding yield,bonding yield直接等于HBM产能。
但问题是,这条耗材链上谁真正有定价权。台厂的强项一直在设备和通路端。弘塑做ECP设备、辛耘做wet process清洗、中砂做pad和diamond disc,全部围绕化学品消耗量做文章,本身不掌握配方。崇越和华立是代理通路,帮信越、Fujimi把材料送进产线。真正自研CMP slurry配方的只有达兴和长兴,体量跟Fujimi、Entegris完全不在一个量级。化学配方的壁垒跟设备不一样,设备可以逆向工程迭代追赶,配方是几十年经验数据的堆叠,一款slurry打进台积电标准制程通常五到十年不会被替换。达兴说它的CMP slurry已经应用于N2并供货Arizona,如果属实,至少过了初步验证。但”应用于”和”规模化供货”之间的距离,有时候比技术本身还远。
资金从CoWoS设备capex转向耗材opex,方向没问题。但耗材链上真正有定价权的那一段在谁手里,市场似乎还没想清楚。
顯示更多