登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント @snorbe_ai を作っています。 @deskrex | 著書 かんき出版『知的生産でAIを使いこなす全技法』 
392 フォロー中    2.6K ファン
AIのシステムプロンプト(ユーザーには見えない、開発者が事前にAIへ埋め込む行動指示)を、実際に流出・公開された88の商用AI製品から集めて監査した論文が出ていた( 論文はAISPA(Artificial Intelligence System Prompt Assurance)という枠組みを使い、身元の透明性・誠実さ・プライバシー保護・安全な行動など8つの観点から3249個の指示を「ユーザーを守る指示」か「ユーザーの不利益になる指示」かに分類している。 結果、88製品中87製品は最低1つ保護的な指示を持つ一方、8観点すべてをカバーしているのはわずか23.9%。さらに34製品(38.6%)には、ユーザーの利益に反する指示が少なくとも1つ混じっていた。プロンプトの平均文字数も2024年の9千字強から2025年には3万字超へ、保護的な指示の数も15.0個から38.4個へと2倍以上に増えている。 企業ごとの差も大きく、Anthropicは製品あたり平均62.3個の保護的指示・0.1個の問題ある指示ともっとも手厚い一方、Veniceだけは問題ある指示(3.0)が保護的指示(2.0)を上回っていた。 グレーゾーンの指示も見つかっている。あるプロンプトはAIに自らを「友達」と名乗らせ、会話を終えようと提案することを禁じていた。見えない場所でAIの人格は、こうして日々設計されている。
もっと見る
大規模言語モデル(LLM)に「株の大口注文をいつ・どれだけ売買するか」を決めさせる研究が出ていた( 機関投資家が大きな注文を一度に出すと価格が動いて損をするため、小分けにして執行する(親注文執行)のがアルゴリズム取引の基本課題。従来はTWAP(注文を時間で均等に分割する手法)のような固定ルールか、個別に学習させたモデルに頼るしかなく、市場の前提が変わるたびに弱くなったり再学習が要ったりした。 この論文が提案する「PACE」(先読み制御執行、の意)は、LLMに役割を分けて執行させる。Planner役が数十分単位の値動きの方向性を読んで大まかな配分計画を立て、Executor役がそれをもとに数分単位で数量を上下させる。市場の前提を置かず、専用の学習も不要というのが利点。 深セン証券取引所の実データで検証したところ、PACEはTWAPやAlmgren-Chriss(伝統的な最適化手法)、XGBoost/LSTM(学習ベースの手法)をすべて上回り、最も成績の良かった手法よりも0.65bps(ベーシスポイント、1万分の1)高い成績を出した。年間1000億ドルを取引するファンドなら年間650万ドルのコスト削減に相当する規模で、1,680件の注文全体でLLMのAPI利用料はわずか30ドル程度だったという。 行動特性も興味深く、人間の投資家は自信過剰だと成績が悪化しやすいが、このLLMは自信度が高いときほど成績が良かった。締め切り間際に慌てるのではなく、早めに多く取引を終わらせる傾向も見られた。
もっと見る
画像を見ながらOCRや検索といった外部ツールを使って答えを出すマルチモーダルAIエージェントの評価を、最終的な正解率だけで済ませるのは足りない、と指摘する論文が出た( 正解にたどり着けたとしても、それが根拠のある推論の結果なのか、途中の誤りがたまたま打ち消し合って正解しただけなのかは、最終的な正誤だけでは見分けがつかない。論文はこうした失敗パターンを4つに整理しているが、なかでも厄介なのが「Phantom Grounding」と呼ぶ現象だ。証拠そのものは正しく引用しているのに、結論に出てくる数字や固有名詞がその証拠には書かれていない、一見もっともらしいのに中身が伴わないケースを指す。 研究チームが提案するLedgerMindは、推論の途中経過を1本のテキストに垂れ流すのをやめ、ツールの出力(OCR結果や検索結果など)を出どころ・種類・信頼度付きの「証拠台帳(Structured Evidence Ledger)」として記録する。以降の推論は台帳に載っている証拠しか引用できないうえ、引用しているだけでは不十分だとして、結論の数字や固有名詞が引用元の証拠と実際に一致しているかまで照合する。簡単な質問には軽い経路、複雑な質問には重い経路へ自動で振り分け、余計な深読みで正しい答えを崩す「考えすぎ」も防ぐ。さらに、間違いに気づいたときの修正も自由に書き直させず、証拠の差し替えやツールの呼び直しなど決まった操作だけに絞っている。自由な書き直しは、直しているつもりで新しい未検証の主張を紛れ込ませやすいためだ。 VTC-Benchというベンチマークでは、Gemini-3-Flashと組み合わせて58.9%(同じモデル単体の素の性能から+12.4ポイント)まで伸ばし、既存手法の最高値を更新している。検証した中で一番性能が低かったKimi-K2.6ほど伸び幅が大きく、あるサブベンチマークでは正解率が19.5%から46.0%(+26.5ポイント)まで跳ね上がった。もっとも興味深いのはアブレーション実験(仕組みを1つずつ外して効果を確かめる実験)で、この証拠台帳を丸ごと外すと正解率が68.9%から53.5%まで急落する。「証拠を引用しろ」と指示するだけでは足りず、構造として引用先を強制する部分こそが効いている、という結果だ。
もっと見る
Aureka BiotechnologiesがUS$100 millionのSeries Bを調達した( million近くに達したという。Granite Asiaが第1トランシェを単独で拠出し、後続トランシェは戦略投資家が主導、HighLight Capital(HLC)と既存株主のMPCi、NRL Capitalも参加した。 資金の使い道が興味深い。次世代の生物学的基盤モデルを大規模に訓練し、de novo分子設計(既存分子の改変ではなく、ゼロから候補を設計すること)、生体構造モデリング、機能予測を強化する。同時にLab-in-the-Loop(モデルの仮説を実験で検証し、その結果を次の学習へ戻す仕組み)も拡張する。 ここでいう実験は、最後に答え合わせをするだけの工程ではない。AIエージェントが分子を生成し、実験を設計し、単一細胞の機能スクリーニングや高スループット検証で確かめ、結果をモデルへ戻す。モデル→実験→データ→更新の循環そのものを、薬物探索の基盤にしようとしている。 Aurekaの生物学的基盤モデルAuraIDEは、社内のタンパク質共進化データで訓練されている。オープンソース版のOpenDDEは、抗体と抗原の立体構造予測を測る公開ベンチマークFoldBench v1の第三者評価でも紹介された。 創業者兼CEOのWeian Zhaoは、最終的に生物学的ワールドモデルを目指すと説明している。これは分子の静的な構造を当てるだけでなく、分子同士の相互作用や設計結果をシミュレーションし、AIエージェントが薬の設計を計画、実行、反復するモデルだ。 「モデル単体の性能」を競う段階から、「実験データをどう継続的に生み、モデルと薬の候補を同時に更新するか」を競う段階へ。Aurekaの発表は、AI創薬の本体がモデルではなく、モデルと実験を閉ループで接続するR&Dインフラへ移りつつあることを示していると思う。
もっと見る
River AIが、シードとシリーズAを合わせて11億ドルを調達した( 6月10日の会社発表から約2カ月で、この規模。General CatalystとAMP PBCが主導し、NVIDIAとAMD Venturesが戦略投資、Y CombinatorとTemasekも参加している。 Riverが目指すのは、汎用AIを借りて使うだけの世界ではなく、企業や個人が自分で訓練し、所有できる「パーソナルAI」だ。最初の製品であるRiver APIでは、強化学習(試行錯誤の結果を報酬として学ぶ手法)とLoRA(モデル全体を作り直さず、一部の重みだけを調整する手法)を使い、オープンウェイトモデルを用途に合わせて変えられる。 同社によると、複雑な強化学習もインフラ専門チームなしで15〜20分で完了し、クローズドな代替手段に比べてコストを2〜4倍抑えられるという。これはRiver自身の公表値で、第三者評価はこれからだ。 11億ドルが賭けられた先は、単なる巨大モデル競争ではない。モデルを誰が所有し、誰のために学び続けるのかという、AIの主導権そのものだと思う。
もっと見る
浙江大学と清華大学の研究チームが、ロボット制御向けの世界モデル(行動を起こすと画像がどう変わるかを予測するモデル)に対して、探索なしで行動を決められる新しい学習法「INTACT」を提案した(https://arxiv[.]org/html/2607.26056v1)。 画像はその全体構成。従来はゴールに近づく行動をCEM(大量の行動候補をランダムに生成してシミュレートし、良さそうなものを選ぶ探索的な計画手法)で毎回探すのが定番で、1回のプランニングに平均1.48秒かかっていた。INTACTは同じオフラインの実演データから「今の状態から実際に起きた変化」と「今の状態からゴールまでの差分」の両方を、1つの共有した行動予測モジュールに同時学習させる。これにより探索を一切使わずにいきなり行動が出せるDirect制御が可能になり、レイテンシは2.9〜5.5ミリ秒まで縮んだ。 PushT/Cube/Reacher/TwoRoomの4タスクをそれぞれ個別に学習したモデルでも、Directだけで成功率85.78%/100.00%/97.67%/97.89%を達成。Direct案の周辺だけをCEMで軽く確認するごく小さな検証(候補384個、CEMの9,000個の23分の1)を足すと、4タスク平均96.86%、最も苦手なタスクでも92.22%まで伸びる。1つのエンコーダ(画像を圧縮した表現に変換する部分)で4タスクを同時に学習させても平均89.39%届き、土台となった従来の世界モデル「LeWM」に対しタスクによっては最大42.44ポイント差をつけた。 興味深いのは、同じ共有エンコーダの設定で行動を出す部分を完全に無効化し、旧来のCEM探索だけで評価しても、INTACTの目的関数で学習した表現のほうが成功率が66.17%から70.08%に伸びる点。行動予測ヘッドを追加しただけでなく、世界モデルの表現そのものを底上げしていることになる。
もっと見る
深層学習の歴史を振り返ると、AlexNetが「手作業で工程を分けるより、入力から出力まで丸ごと1つのモデルで学習させる(end-to-end)方が強い」ことを示したのが革命の始まりだった。ところが生成AIだけはこの流れに乗り切れていない、という指摘から始まる論文が公開された(https://arxiv[.]org/html/2607.27372v1)。 拡散モデルや自己回帰モデル(要素を1つずつ順番に予測して生成するモデル)など、今の生成AIはどれも「生成の手順を細かいステップに分解する」ことで動いている。拡散モデルなら、ノイズだらけの画像を少しずつクリアにしていく数百ステップだ。これは「1つの入力に無数の正解がありうる」多峰性(複数の正解パターンがある)分布を、各ステップではほぼ一意な予測に絞り込むための工夫だが、この分解のせいで学習時(1ステップだけ予測)と推論時(数百ステップ繰り返す)でやっていることが食い違い、end-to-end(学習と推論の手順を完全一致させる訓練方式)にはなっていなかった。 この論文の「Explorative Modeling(探索的モデリング)」は逆転の発想で、生成の手順は分解せず学習ループ自体を分解する。各学習ステップでモデルに複数の候補を生成させ、正解データに一番近いものだけを使って学習する(best-of-k方式)。候補が1個だとモデルの最善手はすべての正解の平均になりぼやけた画像しか出せないが、候補をk個に増やすとそれぞれが別々の正解パターンを担当できるようになる。論文中の犬画像の比較が分かりやすく、候補1個ではほぼ完全にぼやけた模様、候補50個まで増やすと元画像とほぼ見分けがつかない鮮明さになっている。 この「探索の量」はパラメータ数・データ量に続く第三のスケーリング軸として機能し、画像・動画・言語のすべてで性能が単調に向上する。しかも効果はスケールが大きくなるほど強く、データ量を増やした場合の改善幅は7%から36%へ、モデルサイズを増やした場合は13%から23%へ拡大した。効率面ではFLOP(計算量)効率が4.1倍、サンプル効率が6.2倍、パラメータ効率が47%改善し、最強の画像生成レシピではImageNet 256×256でガイダンスなし1.43 FID(生成画像の品質指標、小さいほど良い)というほぼ最先端の性能に到達している。動画生成では過学習も抑えられ、FVD(動画品質指標、小さいほど良い)の最良値が探索なしの37.5から探索ありで30.0まで改善した。 さらにロボット制御タスクでは単体のend-to-end生成モデルとしても機能し、拡散モデルベースの手法と同等の性能を推論ステップ数16分の1から256分の1で達成した。数百回繰り返していた予測が、たった1回の計算で済むことになる。
もっと見る
Microsoftの研究チームが、画面を操作するAIエージェント(computer-use agent)を訓練するための合成環境「Echoverse」を発表した(https://arxiv[.]org/html/2607.28074v1)。 AIエージェントは、自分の操作が実際に何かを変化させる場でしか学習できない。でも本当に鍛えたい相手はメールや銀行、カルテのようにログインが必要で状態が刻々と変わる(stateful)アプリで、本物のサービスを壊すわけにはいかない。そこでデータベースごと丸ごと動く合成環境を代わりに使う。 これまでの手法はこうした合成環境を大量に作ることに力を入れてきたが、この論文は数より深さだと主張する。レシピサイトAllrecipesを模した環境で試したところ、浅い環境で訓練すると実際にベースモデルより性能が落ちてしまった。逆に、権限やエラー処理が本物通りに動き、最初の選択が後の展開を左右するような深い環境で訓練すると、同じドメインで性能が上がった。 合否判定にも工夫があり、スクリーンショットをAIに見せて「できていそうか」を判定させるのではなく、実際のデータベースの差分を正解データと突き合わせる「grounded grading」を採用している。エージェントが完了したふりをしても見抜ける仕組みだ。 結果、先ほど例に挙げたメールや銀行を再現したEchoMailやEchoBankなど10個の業務ドメインに、日付ピッカーなど特定の操作だけを鍛える2個の環境を加えた計12環境、2万1009本の実行履歴を使って90億パラメータのモデル(Qwen3.5-9Bベース)を訓練したところ、14項目の評価平均でベースモデルの36.5%から67.1%まで伸び、この訓練データを作った教師モデルGPT-5.4の80.7%まで14ポイント差に迫った。 面白いのは、EchoStay(民泊予約の模擬環境)で宿泊人数を指定する操作が正しく機能しないというバグを1つ直しただけで、それまで完了できなかった予約タスク24件のうち15件が新たに通るようになったこと。環境のバグ修正が、そのまま多数のタスク改善につながる。 さらにこの合成環境はそのまま強化学習の訓練場にもなる。正確にリセットでき、並列実行でき、報酬がデータベースの状態に基づくため信頼できるからだ。環境の数を増やすより、モデルが実際につまずく場所を見つけて環境ごと直し続けるループが効くという結論。
もっと見る
VLM(画像を見て言葉で答える大規模言語モデル)に専門ツールを使わせて学ばせたあと、使い方ごと本体に染み込ませてツールを手放せるようにする学習手法SpatialCLIが発表された(https://arxiv[.]org/html/2607.27703v1)。 VLMは「机の上で一番遠いクマのぬいぐるみはどれか」のような課題全体の理解は得意だが、実際の距離を正確に測るのは苦手。SAM 3(輪郭を切り出す専門モデル)やDepth Anything 3(奥行きを推定する専門モデル)は精密だが、どのクマを見ればいいかという文脈判断ができない。しかもこうした専門ツールは呼び出すたびに時間がかかり、学習時点の計測では1回あたり平均2.916秒だったという。 SpatialCLIの名前は、位置特定・輪郭抽出・奥行き・姿勢推定という4つの専門ツールをVLMに呼び出させるCall、お手本の成功例と強化学習(GRPO)でツールの選び方を磨くLearn、ツールを使って解けた過程を文章に変換しツールなしでも同じ結論に辿り着けるよう学習し直すInternalizeという3段階に由来する。ツールを使う学習と使わない学習を同時に行うため、ツールの使い方を忘れずに専門能力だけをモデル本体に取り込める。 新設した516問のベンチマークSpatialCLI-Benchは、フロンティアモデルのGPT-5.6 Solでも正答率48.8%にとどまる難問揃い。Qwen3-VL-8B(80億パラメータ)にSpatialCLIを適用すると、ツールなしで35.3%から72.7%、ツールありでは91.3%まで伸びた。視点を変えながら空間関係を捉える力を測る別のベンチマークMindCubeでも29.3%から84.6%(ツールあり)に達し、同じ条件のGPT-5.6 Sol(72.1%)を上回っている。 ツールを使わせて学ばせてから、学んだことを染み込ませて手放させる。この順番が、身体を持つAIが現実世界の空間を扱えるようになる道筋の一つになりそうだ。
もっと見る
AIで「合成ユーザー」を作り出すSimileが、非公開の「ステルスモード」を解除してからわずか5か月で2億ドル超のシリーズBを調達し、評価額20億ドルに達した(https://techcrunch[.]com/2026/07/30/synthetic-user-startup-simile-raises-200m-at-2b-valuation-5-months-after-100m-series-a/)。Simile自身は「シミュレーション企業」を名乗り、人間の行動そのものを再現することを事業の軸に据えています。 今回のラウンドはGreenoaksとIndex Venturesが共同でリードし、Hanabi、Bain Capital Ventures、A*、Factory、CVS Health Ventures、Definitionが参加しました(同社発表による)。Index Venturesは前回のシリーズA(1億ドル)もリードした投資家です。 Simileによると、この5か月で売上は5倍に伸び、Fortune100企業(米フォーチュン誌が選ぶ売上上位100社)向けに数千万件規模のシミュレーションを実行できる基盤モデルを構築し、各シミュレーションの精度を予測する「confidence model」(同社いわく世界初)も訓練したといいます。本拠地だった米パロアルトの小さなオフィスから、従業員50人超のグローバルチームに拡大しました。CVS Health、Wealthfront、Deloitte、Gallupといった企業が、製品発表の戦略立案や顧客体験の最適化、新市場への参入にすでに活用しているそうです。 創業者のJoon Sung Park氏はスタンフォード大学で博士号を取得しており、在学中には、AIエージェントが人間のように暮らしパーティーまで開く「Smallville」という研究プロジェクトを手がけていました。Simileは「地球上の80億人全員を正確かつ誠実に再現する」ことを掲げていますが、TechCrunchはこのミッションを荒唐無稽だと評しつつ、人間は感情と理性の両方に左右され予測不能だからこそ市場調査が必要だという前提を踏まえてもなお、合成ユーザーによるリサーチ自体は有望な領域であり、プロダクトのモックアップ作りにおける「vibe coding」(直感を頼りにAIへコードを書かせる開発スタイル)のような立ち位置だと評しています。 同分野では2025年12月にシリーズAで巨額の評価額10億ドルを付けたAaruという競合も登場しており、投資熱の高さがうかがえます。
もっと見る
これは凄く興味深い 5世紀の間に渡って思考 検証された学問が現在の最新の知識システム上でどう動き 検証されたと言う論文
NTUの研究チームが、複数のLLMをまとめる司令塔(セントラルモデル)向けに、新しい記憶の仕組み「Σ-Mem」を提案した(https://arxiv[.]org/abs/2607.27958)。 画像はその動機を示す例。複数のエージェント(ピア)が「Berlin」で一致しても、参照元の資料が見えないセントラルモデルには正誤を判断できない(正解はZurich)。複数の意見が揃っていることは、correlated errors(同じ思い込みを共有した誤り)である可能性もあり、単純な多数決はかえって逆効果になりうる。 Σ-Memは、各ピアの過去の実績(historical competence evidence)と、ピア同士の相性(peer relationship evidence、一緒に正解しやすいか間違えやすいかの関係)を、数値の表(対称行列)としてずっと記録し続ける仕組み。1回の更新で変化できる幅を一定に抑える(Weylの不等式という定理で保証)ことで、モデル自体を再学習せずに安定してオンライン更新できる。 Qwen3系とQwen3.5系あわせて5モデルで検証したところ、信頼できるピアを意図的に入れ替える意地悪な設定(CF@90)で、Qwen3-0.6Bの正解率が46.22%から71.10%まで向上した。学習に使っていない未知のピアを後から追加しても効果は落ちず、学習対象外の領域(BBHなど)を含む30ケース中27ケースで性能が改善している。 興味深いのは、セントラルモデルの判断を介さず、質問文だけから「どのピアを信頼すべきか」を記憶だけで決める方式(M-route)でも、多数決や固定の最良ピアより高い精度が出た点。「誰を信頼するかの記録」そのものが、判断材料として機能することを示している。
もっと見る
マルチモーダルAI(画像と文章を一緒に理解して答えるAI)が「自分で描いた図を本当に見て考えているか」を検証した論文が出た(https://arxiv[.]org/abs/2607.26769)。 GPT-5.5やGemini 3.5 Flashなどの最新モデルは、問題を解く途中で補助線を引いたり対象に印をつけたりと、人間が紙に書き込むような視覚的な操作を自分で生成しながら考えるようになってきた。ただ、その絵が答えを導く助けになっているのか、単なる飾りなのかは、これまできちんと切り分けられていなかった。 研究チームはSee2Thinkという評価の枠組みを作った。幾何・3D空間認識・日常シーンの読み取りなど12カテゴリ、合計1,200問を用意し、AIが「考える→図を描く→描いた結果を見てさらに考える」流れを記録する。実験の一つでは、AIに見せる描画結果をわざと間違ったものにすり替え、AIが本当にその絵に依存しているかも確かめた。 結果はややちぐはぐだった。AIが「どこに何を描くべきか」を選ぶ判断の妥当性(論文ではAction Relevanceと呼ぶ指標)は全体平均で96.4〜98.8%とほぼ満点なのに、実際に描いた絵が指示通り正確に再現されているか(Render Faithfulness)は58.6〜65.6%にとどまる。狙いは正しくても手元が狂う工程こそが最大のボトルネックで、どの条件が一番強いかもモデルごとにバラバラで万能な戦略はなかった。 「指定された麻雀牌を1枚拾う」のようなロボット操作の指示になると、モデルや条件を問わず正答率は0〜4%まで落ち込む。さらに、わざと間違った絵を見せる実験では特に3Dの空間問題で正答率が最大15.5ポイントも落ち込んだ。正確に描けても得点はさほど伸びないのに、間違った絵には引きずられて答えを変えてしまう。「絵を使って考えるAI」も、まだ自分の描いた絵を十分に使いこなせていない、という結果だ。
もっと見る
AlibabaのQwenチームが実機重視のGUIエージェント「Qwen-UI-Agent」を発表した(https://arxiv[.]org/html/2607.28227v1)。GUIエージェントとは、画面を見て人間のようにタップや入力を行い、スマホやPCのアプリを操作するAIのこと。 多くのGUIエージェントはシミュレーター上のベンチマークには強くても、実際のスマホやPCで動かすと崩れやすい。Qwen-UI-Agentはこのギャップを埋めるため、実機100台以上・150以上のアプリを使った学習と評価に踏み込んでいるのが特徴。 結果は明確で、実機ベンチマークのMobileWorld-Realで92.2%(Claude Opus 4.8を7.5pt上回る)、AndroidDailyで97.5%を記録。ブラウザ操作のWebArenaも73.6%でOpus 4.8を1.7pt上回りトップ。一方でPC操作のOSWorld-Verifiedは79.5%とOpus 4.8(83.4%)に次ぐ2位で、全ての土俵で首位というわけではない。 行動の出し方にも工夫がある。GUI操作とCLI(コマンドライン、文字でコマンドを打ち込む操作方式)を状況に応じて使い分け、複数の操作をまとめて1ターンで出す「バッチ化」を導入。PC操作タスクではアクションの4割以上がバッチ化され、実行ステップ数を大きく減らしている。 面白いのは「先回り」の発想も持たせている点。フライトキャンセルの通知が届いたら、ユーザーが気づく前に代替便を探し、予定と照らし合わせて提案する、という使い方まで想定している。ベンチマークの数字より先に、実機で本当に使えるかを問うアプローチが徹底している。
もっと見る
ロールプレイAI(キャラになりきって会話するAI)のベンチマークは、実はどのモデルにも同じ「借り物の会話履歴」の続きを書かせて採点しているだけだったという論文(https://arxiv[.]org/abs/2607.27816)。 渡す会話履歴の質を上げただけで同じモデルの採点が平均0.21点(5点満点)上がり、劣化させると0.13点下がることが実験でわかっている。モデル自身の実力ではなく、渡された「お膳立て」の質を測ってしまっているわけだ。 もう一つの問題は採点基準(ルーブリック)が全員共通なこと。じっくり関係を深める会話が好きな人もいれば、テンポよく展開してほしい人もいるので、一律の基準では「その人にとっての満足度」は測れない。 そこでPALATEという新しいベンチマークは、5人の実ユーザーの本物の会話ログ(1人あたり約1,000ターン)でLoRA(モデルの一部だけ軽く追加学習する手法)を作り、「その人らしく話すAI」を再現する。このAIがロールプレイAI候補と自由に会話して、その場で評価用の会話を作るので、借り物の履歴に頼らず公平になる。採点基準もその人の過去の満足度データから個人専用に自動生成していて、論文の図には「そっけない態度の中に見える思いやり(Hard shell, soft care)」のような、人によって全然違う評価軸が並ぶ。 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Proなど16モデルで検証したところ、全ユーザーに勝つモデルは1つもなかった。ユーザーごとに一番相性がいいモデルが違い(Qwen3-Max、DeepSeek V4 Pro、Claude Opus 4.8、Claude Sonnet 4.6がそれぞれ別のユーザーで1位)、総合1位はGPT-5.4だったが、これは一言一言の受け答えの質(Generic評価)で強いのが理由で、会話が長く続いたときの一貫性(Session評価)ではClaude Sonnet 4.6が最も高いスコアだった。一言一言の上手さと、長い会話が破綻しないことは別の能力だという指摘で、ロールプレイAIの「強さ」は1本のランキングだけでは測れないという結果になっている。
もっと見る
イスラーム法学の「ハディース学」を、AIエージェントが積み上げる知識ベースの信頼性判定に応用した論文が出ている(https://arxiv[.]org/html/2607.24117v1)。 複数のAIが協調して知識ベースを作る仕組み(スクレイパーが情報を抽出し、要約モデルが整理し、別のモデルが回答を合成する、という何人もの「手」を渡り歩く構成)では、来歴管理(provenance、誰が何をしたかの記録)があっても「この主張を信じていいか」までは答えられません。著者が持ち込むのは、預言者ムハンマドの死後にイスラーム法学者が約1200年かけて磨いた手法です。伝承の連鎖(isnād)を必ず記録し、伝承者ひとりひとりの信頼度を個別に格付けする(rijāl)という考え方です。 鎖全体の信頼度は一番弱い伝承者で決まる「弱点連鎖」が基本ルールです。最後にどれだけ賢いモデルが回答を合成しても、途中の抽出段階が壊れていれば意味がないという発想です。ただしAI向けの調整もあり、情報を壊すだけの処理(抽出や要約)は単純に最小値評価にする一方、情報を作り直す処理(生成モデルによる合成)は自分の格付けの範囲内でなら信頼度を持ち上げる方向にも動けます。弱点連鎖だけでは厳しすぎる場面を救うため、互いに独立した複数の連鎖が同じ主張を裏付ければ格上げする「相互証明」の仕組みも入っています。さらに、連鎖の信頼度が高くても中身が正しいとは限らないため、伝承の連鎖とは別に主張の中身そのものが既存の知識と矛盾していないか個別にチェックする仕組みも組み込まれています。実際に物理学の教科書(OpenStaxとCrowellの教科書)に適用した事例研究では19件の矛盾が見つかり、全て人手確認で本物と確認されました。多くは「古典力学とフォトンとで運動量の扱いが違う」ように、間違いではなくどちらも正しいが前提となる理論が違うだけ、というケースだったそうです。 本評価では同じ物理学教科書から抽出した2万件の主張を使い、信頼度の異なる4つの「伝承者」(モデルやスクレイパーのバージョン、故障率は1%・2%・15%・18%)を混ぜてテストしました。最も信頼度の低い伝承者を含む連鎖4,057件(全体の29%)は漏れなく検疫(要注意の主張を人の目に回す措置)され、原因となった伝承者まで追跡できています。一方で、監査ログから自動的に信頼度を学習する仕組みは4つの伝承者のうち3つは正しく回復できたものの、実験内で最も故障率が高かった伝承者(18%)は該当分野での事例が少なすぎて一度も格付けされず、見逃されました。さらに実運用でのカバー率を決めているのは主張の矛盾を見抜く「批評」担当モデルの性能で、参照実装は単語の重なりを見る程度の簡易版だったため大半の文章を「判定不能」としてしまい、カバー率は4.8%止まりだったとも正直に報告されています。 うまくいった部分といかなかった部分の両方をはっきり書いている点も含めて、複数エージェントで知識を積み上げるシステムの設計を考える上で参考になりそうです。
もっと見る
歌声とBGMをまとめて曲ごと生成できるAIモデル「WanSong v1.0」の技術レポートが公開された(https://arxiv[.]org/html/2607.14749v1)。 これまでの曲生成AIは、AR(自己回帰、文章を単語ごとに予測して繋げる方式で音を生成)か、ARと拡散モデル(ノイズから徐々に音を復元する生成方式)を組み合わせた多段階パイプラインが主流だった。WanSongはこの構成をやめ、拡散モデルだけで最大5分の高音質な楽曲を一発生成する、約250億パラメータ(25B)のモデル。しかもボーカルとBGM(伴奏)を別々の音声トラックとして同時に出力する。 このdual-stem(2軌道)構成には理由がある。ボーカルとBGMを1つのトークンにまとめて学習すると、モデルがボーカルに引っ張られてBGMの表現が弱くなる。さらに生成の忠実度を調整するCFG(Classifier-Free Guidance)を強めるとボーカルは正確になるがBGMが崩れ、弱めるとその逆が起きるというジレンマもあった。WanSongはボーカルとBGMを完全に別トークンとして学習し、この干渉自体をなくしている。副産物として生成直後から両者が別トラックのまま得られるため、後工程のミックスや編集もしやすい。 600万時間超の多言語楽曲データで学習し、中国語・英語・日本語・韓国語4言語・200曲のベンチマークでは発音誤り率(PER)が7.43%と、Suno V5の22.80%、Mureka V7.6の12.7%を大きく下回った。独自の音楽性評価でも5.49点でSuno V5の4.18点を上回っている。
もっと見る
モデル自身に長い文章の中から使えそうな部分を選ばせてから、その部分だけで一時的に学習させる手法をMeta AIとバージニア大学が発表した(https://arxiv[.]org/html/2607.09415v1)。 近年のLLM(大規模言語モデル)は数十万トークンの長文を一度に読めるようになったが、扱える入力の長さ(コンテキストウィンドウ)を広げるだけでは長文を有効に使えるとは限らない。入力が長くなるほど正解率が下がる現象が知られていて、質問に関連する証拠を見つけて使う能力がボトルネックになっている。 有望な解決策がテスト時学習(TTT、Test-Time Trainingの略)だ。答える前にテスト入力そのものを訓練データとしてモデルの重みを一時的に更新する手法で、長文脈タスクとの相性が良いとされてきた。ただし長文脈全体を学習に使うのは計算コストが高く、ランダムに抜き出した断片を使うと無関係な情報がノイズになる。 著者らはLLMの長文読解力を測るベンチマーク「LongBench-v2」で診断実験を行い、興味深い結果を得た。ランダムな断片で学習させるとベースモデルの正解率40.4%が38.9%まで下がる一方、正解を教えられたうえで判断するGPT-5.5が選んだ「本当に必要な部分」だけで学習させると45.9%まで伸びた。TTTの効果は学習させる部分の質に強く依存している。 これを受けて提案されたのがSelf-Guided TTT(S-TTT)だ。2段階構成で、まずモデル自身に長文脈の中から質問に関連しそうな部分を原文のまま抜き出させ(Stage 1)、その部分だけを使って次単語予測(次にくる単語を当てさせる、通常のAI学習と同じ方式)で一時的に学習させる(Stage 2)。最終的な回答生成は元の文脈全体を見て行う。 Qwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方で検証したところ、ベースモデルは一貫して上回り、ランダムに断片を選ぶ手法や文脈全体を使う手法など既存のTTT手法に対しても総じて上回るか同等の成績を残した。最大では15%の相対的な改善を達成している(Qwen3-4B-Thinking-2507、LongBench-v2の64k〜128kトークン帯域で正解率30.7%→35.3%)。 パープレキシティ(次単語の予測しにくさ)やエントロピー(予測の不確実性)が高い部分を選ぶより、モデル自身が「質問に関連しているか」で選ぶ方が明確に優れていた点も興味深い。難しい部分を学ばせればいいわけではなく、質問との関連性を見極める判断力そのものが効いているらしい。
もっと見る
タオバオを運営するアリババが、ECサイトの「あなたへのおすすめ」を支えるレコメンドAI「RecGPT-V3」の技術レポートを公開した(https://arxiv[.]org/html/2607.15591v1)。数億人規模の日次アクティブユーザーを抱えるタオバオのホーム画面「Guess What You Like」枠に実際に投入し、本番A/Bテストまで行った上での報告。 前身のRecGPT-V1・V2は「ユーザーの行動履歴を読んでLLMに意図を推論させる」設計で成果を出してきたが、大規模運用の中で3つの壁にぶつかった。 1つ目は、リクエストのたびに行動履歴を全部読み直す非効率さ。V3は「Memory Hub」というユーザーごとの永続的な記憶層を新設した。ガジェット好き、バドミントン好き、育児中といった興味ごとにメモリユニットとして蓄積しておき、新しい行動が来たら該当ユニットだけを差分更新する仕組みに変えることで、ユーザー理解にかかる計算コストを55.8%削減している。 2つ目は、LLMが出す自然言語タグと実際の商品とのズレ。「バドミントンラケットスタンド」のようなタグ1つに幅広い商品群が対応してしまい、本当に欲しい商品を絞り込む手がかりが失われていた。V3ではLLM(ベースはQwen3-14B)の語彙に、商品の意味を離散コードで表す「Semantic ID」を65,536個追加し、自然言語とSemantic IDの両方で推論できるハイブリッドモデルにした。 3つ目は、精度を上げるための思考の連鎖(Chain-of-Thought、答えを出す前にLLMが踏む思考ステップ)が長すぎる問題。1サンプルあたり2,840トークンにも及ぶ思考過程が推論を遅くしていた。V3は「Latent Intent Reasoning」でこれをわずか10個の潜在トークンに圧縮しつつ、必要なときは人が読める説明文に復元できる仕組みも保っている。論文中の実例では、この10トークンだけから、本格派で攻撃的なプレースタイルのバドミントン好きでフルカーボンラケットやガットが必要、という趣旨の説明文まで復元できたと報告されている。出力トークン数は95.7%減り、処理速度は3.46倍(1,020秒から295秒)になった。 結果、本番A/Bテストではフィードで商品詳細ページ閲覧数(IPV)が1.28%、クリック率(CTR)が1.00%、取引件数(TC)が1.97%、流通取引総額(GMV)が3.97%向上しながら、サービング全体の計算コストは52.4%削減された。精度とコストを同時に改善できているのが実運用ならではの説得力がある。
もっと見る
「『誰に何を聞くか』を決める仕組み」がプロントのみでは実現不可能で、人為的に特殊な手続きMACE(Multi-Agent Contextual Exploration)を組み込む必要あると読んだ。 AGI/ASIとしての汎化性能の一般的な向上のみで実現し得る可能性はどの程度なのだろうか?
もっと見る