💼 AIエージェントに、架空のスタートアップを500日間まるごと経営させてみたらどうなるか。価格設定もマーケも資金繰りも、全部Pythonコードで回す――その壮大なテストの結果が、なかなか痛烈でした。
短いタスクなら、いまのエージェントはもう立派な実行者です。コードを書き、問い合わせに答え、目の前の課題を片付けます。けれど現実のビジネスは、不確実な中で長い時間軸を進み、ノイズだらけの情報から手がかりを拾い、変化に適応し、無数の意思決定を一つのゴールへ束ねる――そんな総合力の勝負です。この「持続的に前進する知性」は、これまでほとんど測られてきませんでした。
そこで著者らは、CEO-Bench: Can Agents Play the Long Game? を提案します。エージェントは人間のCEOと同じ環境に置かれ、相互に絡み合うノイズの多い業績データベースを読み解き、シグナルを戦略に翻訳し、500日ぶんの経営判断をコードで調整していきます。強いエージェントは、顧客コホートをシミュレートして将来のキャッシュを予測したり、過去の交渉履歴を掘って隠れた顧客の好みを当てにいったりと、驚くほど高度なコードを書いてきます。
それでも、ほとんどの最先端モデルがこの環境で苦戦しました。開始残高100万ドルを上回って終えられたのはClaude Opus 4.8とGPT-5.5の2つだけ。しかもどちらも、安定して黒字を出し続けることはできませんでした。短期タスクの満点と、長期経営の成否のあいだには、まだ大きな隔たりがある――それを突きつける一本です。
URL:
#
AIエージェント# #
LLM#