Register and share your invite link to earn from video plays and referrals.

夜谈
@gntalktalk
提示词咒语工程师,神经网络病患者,ai硅基带路党
Joined January 2011
1.8K Following    3.9K Followers
最新的论文《AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement》制定了目前少见的、专门隔离 RSI 所需算法设计能力而非简单调参能力的测试基准 基准包含10个冻结的真实研究代码库,覆盖监督微调、agentic RL、蒸馏、偏好优化、扩散RL、模型剪枝等10类算法。 论文中的Agent 获得4小时和一张B300修改训练算法,随后其代码在干净环境中重新运行最长12小时,并由隐藏评估器评分。 29种配置的平均归一化分数为0.166,最佳系统0.250;真正触及学习过程的修改平均0.226,其他修改仅0.126。
Show more