TwiScan
热门
社区
账号集合
登录
注册
English
日本語
한국의
简体中文
繁体中文
注册并分享邀请链接,可获得视频播放与邀请奖励。
立即注册
搜索结果
AI4AI
AI4AI 贴吧
一个关键词就是一个贴吧,路径全站唯一。
创建贴吧
用户
未找到
包含
AI4AI
的推特
夜谈
@gntalktalk
2026.08.22 02:00
最新的论文《AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement》制定了目前少见的、专门隔离 RSI 所需算法设计能力而非简单调参能力的测试基准 基准包含10个冻结的真实研究代码库,覆盖监督微调、agentic RL、蒸馏、偏好优化、扩散RL、模型剪枝等10类算法。 论文中的Agent 获得4小时和一张B300修改训练算法,随后其代码在干净环境中重新运行最长12小时,并由隐藏评估器评分。 29种配置的平均归一化分数为0.166,最佳系统0.250;真正触及学习过程的修改平均0.226,其他修改仅0.126。
显示更多
0
0
1
1
0
转发到社区
Xudong Han
@Xudong07452910
2026.08.15 04:09
很多时候,小模型缺的可能就是一套能把能力稳定调出来的 Harness。 这篇《AI4AI at Test-Time》研究了一个很有意思的问题: 能不能让更强的模型,直接给弱模型设计一套更好的工作方式? 作者让 GPT-5.5、Claude Opus、Gemini 等强模型自动修改 Harness,包括 Prompt、任务路由、验证规则和确定性代码。整个过程不更新目标模型的权重。 结果 GPT-5.4-mini 原始平均准确率只有 48.8%,加入自动设计的 Harness 后最高达到 91.2%,甚至超过了裸跑的 GPT-5.4。 而且效果好的 Harness 往往会把一些容易出错的推理交给代码和规则处理,让模型只负责它真正擅长的部分。 所以强模型学到的能力是可以被外化成 Prompt、代码、工具和工作流,再交给更便宜的小模型长期复用。 以后就可以让大模型帮其他模型设计更好的「工作环境」。 📎 arxiv:
显示更多
0
0
17
135
30
转发到社区
丽人Photo 📷
@DnewHome
2026.05.18 00:36
情不自禁⋯⋯ 摄影
@hello19880215
模特
@Aiai50050
0
0
2
2K
63
转发到社区
Mr 酒徒
@hello19880215
2026.06.07 01:04
世事紛紛擾擾 我倆原地躺平…… 💃
@Aiai50050
👉
@Fengsiyuan
👉
@DnewHome
0
0
0
324
9
转发到社区
围子|上海北京广州深圳杭州南京苏州纽约洛杉矶东京悉尼多伦多举行🧳中
@Facaii41
2026.08.14 04:42
网红不好当了,都下海了,真的吗。花样还挺多,据说aiai可以演绎任何场景🎬#
网红
# #
反差
# #
模特
# #
探花
#
0
0
0
0
62
转发到社区
兔兔吖鸭_
@ttyy589364
2026.06.15 06:25
兔兔偷偷在角落摸鱼😋 自己揉奶头 超涩这个视角 (还要时不时防备着有没有同事过)
@luchu888
@luchu777
#
办公室露出
# #
露出诱惑
#
0
0
7
1.8K
80
转发到社区
Huan
@Huanusa
2026.05.13 15:18
华尔街砸300万美金训练的金融AI, 现在普通人0成本就能白嫖了! FinGPT来了——AI4Finance基金会又一个重磅开源项目! 它和BloombergGPT的区别简单粗暴: 一个从零训模型烧300万刀, FinGPT只在开源大模型上用LoRA轻量微调,每次迭代成本不到300美元,还能每周更新最新金融数据! 目前GitHub 20k+ Star,已被NeurIPS 2023正式收录,硬核背书拉满。 最爽的几个能力: 情绪分析:一张RTX 3090就能跑,准确率干翻GPT-4微调版 FinGPT-Forecaster: 输入股票代码+时间,直接给出新闻+行情预测(Hugging Face有在线Demo) 支持Llama-2、Qwen等基座,还能RLHF训出只属于你投资风格的私人AI投顾 金融情绪分析、新闻分类、报告摘要、考试评测……全都能干。 76K+条开源金融数据集随便练手。 它把华尔街级别的金融大模型,真正塞到了普通人手里! 想在AI时代不被市场信息碾压的 赶紧去星标+收藏:
显示更多
0
0
2
149
48
转发到社区
加载中...