가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
가입 May 2026
281 팔로잉 중    421 팬
TL;DR 長いコンテキストを扱えるモデルでも、延々と続く作業を最後まで正しくやり切れるとは限りません。NVIDIAが、その「持続的な実行力」だけを測る新ベンチマークLong-Transductionで検証しました。 タイトル: Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability URL: ポイント 📉 4Kから128Kトークンへのスケールで精度が平均62.8%も相対的に低下 🧮 算術・UUIDソート・変数ルックアップ・CSV表変換の4タスクで持続実行力を測定 📄 128Kトークンで文書を完璧に処理できたのはDeepSeekでも240件中わずか41件(17.1%) 🔀 IDを外すなど入力フォーマットを変えるだけでUUIDソートは最大64.3%低下 🔁 局所的な作業の複雑さが増すだけでも全モデルで精度が一貫して下がる 🤔 モデルは「同じ答えを繰り返す自己一致性」は高いのに正答率は低く、タスクは理解していても文脈から正しい問題を読み取れていない 🛠️ 著者らは安定したIDでの項目化やチェックポイント、タスクの小分けを実務上の対策として提言 対応コンテキスト長やモデル規模の大きさは、網羅的で信頼できる実行を保証しないという指摘が重く響きます。 #AIエージェント# #ベンチマーク#
더 보기