TwiScan
인기
커뮤니티
계정 컬렉션
로그인
회원가입
English
日本語
한국의
简体中文
繁体中文
가입 후 초대 링크를 공유하면 동영상 재생 및 초대 보상을 받을 수 있습니다.
지금 가입
Daisuke Okanohara / 岡野原 大輔
@hillbig
Co-founder and CEO of Preferred Networks (PFN). CEO of Matlantis. Development Strategy Office, Noetra.
가입 January 2008
1K
팔로잉 중
40.1K
팬
Daisuke Okanohara / 岡野原 大輔
@hillbig
2026.08.23 00:23
LLMを使って、数時間から数日、あるいはそれ以上にわたって自律的に仕事を遂行するLong-Horizon Agentの研究が急速に進んでいる。 ここでは、2025年から2026年にかけて登場した代表的な研究の流れを通じて、Long-Horizon Agentに必要な設計原理を整理し、今後の課題や示唆について考察してみたい。 従来のLLMでは、知能の中心はモデル自身の能力ににあると考えられてきた。より強いモデルを作り、より長いCoTを生成させることで、より難しい問題を解くという考え方である。 しかし作業が長期化すると、別の問題が支配的になってくる。 例えば、過去に何を試したのか、間違った仮説を検証した結果がどうだったのか、本来の目的は何だったのか、現在の中間目標は何なのか、といった膨大な履歴や状態を管理する必要がある。単純に一つのLLMのコンテキストへ履歴を蓄積し、それを利用ていくだけでは、こうした情報を維持することが難しくなる。 そのため最近の研究では、 ・モデル ・計画/実行/評価/検証エージェント ・ツール ・環境フィードバック などを含めたシステム全体を設計する方向へと移りつつある。 ここでは、代表的な研究を通じて、この考え方がどのように発展してきたかを見ていきたい。 ■ Darwin Gödel Machine(DGM)2025 DGMは、従来人間が設計していたツール、プロンプト、メモリ管理、ワークフローなどを、AI自身に改良させるという考え方である。 DarwinとGödelという二つの名前が入っていることが、その仕組みを象徴している。 まずエージェントに「自分自身をより良いエージェントへ改造せよ」と指示し、自分のプログラムを変更して性能を改善する。ここがGödel Machine的な部分である。 さらに、常に最高性能のエージェントだけを残すのではなく、過去に生成したさまざまなエージェントをアーカイブし、それぞれから枝分かれする形で探索を続ける。一時的に性能が低下する変更であっても、後に大きな改善につながる可能性があるためである。ここにDarwin的、進化的な考え方が導入されている。 ■ PARC 2025 長期タスクでは、単純な実行能力だけではなく、自分が間違った方向へ進んでいることを検出する能力が重要になる。 PARCでは、Plannerがタスク全体を分解し、Workerが個々の仕事を実行し、その結果を独立したコンテキストを持つエージェントが検証する。その結果をPlannerへ戻し、必要に応じて再計画する。 ここで、エージェント間であえてコンテキストを完全には共有しないという考えが登場してくる。 同じ推論履歴を共有すると、実行側が持っていた誤った前提や思い込みを評価側も引き継いでしまう。独立したコンテキストから評価することで、より客観的な検証を可能にする。 さらに高いコストをかけて検証したもののみを次にわたすという考えも登場する。 ■ Argus 2026 ArgusはPARCの考え方を踏襲し、さらに押し進めている。 長期エージェントでは、誤った情報を一度persistent stateへ書き込んでしまうと、それを前提として後続のエージェントが行動し続け、誤りが増幅する危険がある。 候補となる結果 → Verification → Review → Commit という手続きを取り、検証された情報だけを永続化する。 一方、検証に失敗すればrejectし、必要であれば以前のstageまでrollbackする。 また、成功した知識だけではなく、「この方法は試したが失敗した」というrejected routeも保存することで、同じ失敗を繰り返すことを防ぐ。 このような永続状態へのcommitやrollbackをruntime primitiveとして体系化している。 ■ File-as-Bus / AiScientist 2026 Long-Horizon Agentでは、メモリ管理も大きな問題になる。 コンテキストを長くする研究は進んでいるが、履歴が増え続ければ計算量も増え、必要な情報を見つけにくくなる。 一方、古い履歴を要約する方法では情報損失が生じる。 File-as-Busでは、エージェント同士が会話の要約を受け渡すのではなく、コード、実験結果、設定、分析、仮説などをファイルシステム上のpersistent stateとして残す。 次のエージェントは過去の会話をすべて読む必要はなく、必要になれば元のartifactまで戻って参照することができる。 このような設計思想を「thin control over thick state」と表現している。 制御側は必要最低限の情報だけを持ち、詳細な情報は外部状態としてそのまま保存するという考えである。 ■ InfiAgent 2026 InfiAgentは、この「長い履歴をLLM自身に持たせない」という考えをさらに原理的に押し進めている。 毎回LLMへ渡す情報を、 現在の状態+直近の固定数ステップ に限定し、それより古い情報はすべて外部状態へ移す。 これによって、タスクがどれほど長くなっても、LLMが一回に読むコンテキスト量をほぼ一定に保つことができる。 これは固定長コンテキストを持つLLMにも似ているが、単なる要約だけを保持するわけではない。 元の完全な情報は外部に保存されており、現在のstateには必要な情報や、それらへの参照を持たせる。必要になれば元の情報まで遡ることができる。 つまり、過去に何が起きたかというhistoryを保持するのではなく、現在どうなっているかというstateのみを保持するという転換である。そして、過去に何かおきたかも外部で参照できるようにする。 ここまでの研究は、主としてエージェント自身の目標、中間状態、記憶、ワークフローをどのように管理するかに焦点を当てていた。 次の研究群では、さらに外の世界についてどのように理解を深め、その理解を利用して行動するかが問題になる。 ■ Tycho 2026 Tychoは、ARC-AGI-3のように、ルールもゴールも説明されない未知のゲーム環境を対象にしている。 エージェントは環境との相互作用から、状態、遷移、観測、終了条件などを表現する実行可能なprogrammatic world modelを構築する。 そして過去の観測に対して、そのプログラムが予測する次状態と、実際に観測された次状態が一致するかを検証し、一致しなければ世界モデルを修正する 一方、この研究から分かった興味深い点は、必ずしも正確で詳細な世界モデルを作ればよいわけではないことであり、現在の行動を決めるために必要なレベルまで世界を抽象化してモデル化することである。 Tychoではこの考え方をActive Abstractionと呼んでいる。 ■ AVO 2026 AVOは、これらの考えを備えたLong-Horizon Agentであり、もともとGPUカーネル最適化に使われ、数日間にわたる探索によって高性能なカーネルを発見していた。 そして、その基本的なagent architectureをARC-AGI-3へ持っていっても、public setをほぼ完全に解けたことを示している。 GPUカーネル最適化と未知ゲームでは、問題の表面的な性質は大きく異なるにもかかわらず、同じ仕組みが使えたことになり、エージェントの問題解決・遂行能力が特定のタスクだけに閉じず、ある程度異なる領域にも転用可能であることを示唆している。 ■ これらの研究から見える方向性 これらの研究をまとめると、Long-Horizon Agentの今後についていくつかの方向性が見えてくる。 第一に、一つのLLM、一つのエージェントがすべての履歴を抱えながら改善していく方式には限界があり、記憶は外部化されていく方向に進んでいる。 ただし、外部化する場合には誤った情報を永続化状態へ書き込んでしまうと、後続のエージェントがそれを前提として行動するため、致命的な影響を与える可能性がある。 そのため、ある程度コストをかけて検証され、信頼できると判断された情報だけを永続的な知識として残す必要がある。 この構造は人間社会にもかなり似ている。 現在はファイルシステムやGitといった既存の仕組みが外部記憶として利用されているが、将来的には、現在のジャーナル論文やデータベースのように、検証され、一定の信頼を得た知見が体系的に蓄積されていく、AI向けの知識基盤が作られていく可能性がある。 第二に、エージェント同士があえて情報を共有しないことも重要になる点である。 独立した試行や独立した検証を行いたい場合、すべてのエージェントが同じコンテキストや仮説を共有すると、誤りやバイアスまで共有してしまう。多様なエージェントが独立して考え、その結果だけを統合するような仕組みが重要になるだろう。 第三に、外界を観測して得られた知見を構造化する部分である。 Tychoではこれをworld modelとして扱っているが、さらに広く考えれば、特定分野について蓄積されたdomain knowledgeも同様に外部化・構造化されていくと考えられる。 ■ LLM自体の役割も変わる可能性がある この方向性は、LLMそのものの開発にも大きな示唆を与える。現在のLLMには、知識を大量に持つことと、推論し、問題を解くことの両方が求められている。 しかし外部知識基盤が発達すれば、モデル自身がすべての知識をパラメータの中に保持する必要性は低下していくと考えられる。 その場合、LLMにより強く求められるのは、外部情報を適切に検索する能力、信頼できる情報を選ぶ能力、新しい知識を構造化して外部へ保存する能力、得られた情報から推論する能力となる。 これは現在のLLMの学習フレームワークにも、かなり大きな修正を迫る可能性がある。 ■ 複数エージェントを含むシステム全体をどう学習するか 二つ目の大きな未解決問題は、複数エージェントや外部環境を含むシステム全体を、どのように学習・改善するかである。 外部エージェントや環境まで含めて、強化学習や進化計算によってシステムを改善することは考えられる。 しかし現在の誤差逆伝播法が実現しているような、密なフィードバックや正確なcredit assignment、つまりどの部分を改善すれば最終性能が上がるのかを特定することは難しくなる。 そのため、途中状態や行動を検証したり、評価する評価器が重要となる。 強化学習でいえば価値関数やCriticに近い役割だが、Long-Horizon Agentでは単に将来報酬を予測するだけでなく、現在のエージェントの行動や戦略のどこを変えるべきか、まで指導できる仕組みが必要になると考えられる。 このへんまでいくと人間におけるコーチや教師とかなり近くなってくる。 ■ Multi-Agent Scaling 三つ目は、以前から想定されてきたMulti-Agent Scalingである。 エージェントの数や多様性を増やしたときに、性能や解けるタスクの範囲がどのように拡大するのかは、今後重要な研究テーマになる。 単純に同じエージェントを100体並べるだけではなく、多様性が重要になる可能性が高い。 その場合、それぞれのエージェントが、異なる仮説、探索方針、評価基準、価値観や行動原理を持つことが有効であり、それらをどのように競争させ、協調させ、最終的な知識へ統合するかという問題が生じる。 ■ AIのための新しい外部記憶 最後に、外部記憶そのものも今後大きく進化する必要がある。 現在はファイルシステムやGitなど、人間社会のために作られ、長年洗練されてきた仕組みをそのまま利用している。しかし、人間とAIでは情報処理能力や検索能力、並列性が大きく異なる。 将来的には、大量の原情報を保持しながら必要部分だけを高速に参照できる、情報の信頼度や検証状態を管理できる、仮説や反証の系譜を追跡できるといった、AI向けの新しい永続化記憶装置が必要となるだろう。 私が考える限りGitやWikipediaがかなり近いが、例えばロボットが外部環境をまわって地図情報を更新していくとしよう。この場合、信頼度や異なる情報とのマッピングなどが重要となるがこれらを保存しようとすると異なる仕組みが必要になりそうである。 これらのようにLong Horizon エージェントでは、モデルの外側に、記憶、検証、計画、実行、世界モデル、複数エージェントを含む新しい計算システムを構築し、そのシステム全体を改善してく活動となり、新たな開発が必要となってくる。
더 보기
0
0
9
252
35
커뮤니티로 전달
인기 있는 사용자
New York Post
@nypost
4.2M 팬
オリコンニュース
@oricon
1.9M 팬
First Squawk
@FirstSquawk
568.3K 팬
Reuters
@Reuters
26.4M 팬
TVer新着
@TVer_info
100.8K 팬
吴说区块链
@wublockchain12
181.4K 팬
ツイッター速報〜BreakingNews
@tweetsoku1
256.7K 팬
空空道人
@Kongkongda5882
34K 팬
中國新聞社
@CNS1952
547.4K 팬
モデルプレス
@modelpress
2.1M 팬
billboard
@billboard
16.8M 팬
zerohedge
@zerohedge
3.4M 팬
Bloomberg
@business
10.5M 팬
몬스타엑스_MONSTA X
@OfficialMONSTAX
4.8M 팬
TPE48
@official_TPE48
11K 팬