登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AI高いところ好き部
AI高いところ好き部 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AI高いところ好き部 を含む検索結果
ロールプレイAI(キャラになりきって会話するAI)のベンチマークは、実はどのモデルにも同じ「借り物の会話履歴」の続きを書かせて採点しているだけだったという論文(https://arxiv[.]org/abs/2607.27816)。 渡す会話履歴の質を上げただけで同じモデルの採点が平均0.21点(5点満点)上がり、劣化させると0.13点下がることが実験でわかっている。モデル自身の実力ではなく、渡された「お膳立て」の質を測ってしまっているわけだ。 もう一つの問題は採点基準(ルーブリック)が全員共通なこと。じっくり関係を深める会話が好きな人もいれば、テンポよく展開してほしい人もいるので、一律の基準では「その人にとっての満足度」は測れない。 そこでPALATEという新しいベンチマークは、5人の実ユーザーの本物の会話ログ(1人あたり約1,000ターン)でLoRA(モデルの一部だけ軽く追加学習する手法)を作り、「その人らしく話すAI」を再現する。このAIがロールプレイAI候補と自由に会話して、その場で評価用の会話を作るので、借り物の履歴に頼らず公平になる。採点基準もその人の過去の満足度データから個人専用に自動生成していて、論文の図には「そっけない態度の中に見える思いやり(Hard shell, soft care)」のような、人によって全然違う評価軸が並ぶ。 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Proなど16モデルで検証したところ、全ユーザーに勝つモデルは1つもなかった。ユーザーごとに一番相性がいいモデルが違い(Qwen3-Max、DeepSeek V4 Pro、Claude Opus 4.8、Claude Sonnet 4.6がそれぞれ別のユーザーで1位)、総合1位はGPT-5.4だったが、これは一言一言の受け答えの質(Generic評価)で強いのが理由で、会話が長く続いたときの一貫性(Session評価)ではClaude Sonnet 4.6が最も高いスコアだった。一言一言の上手さと、長い会話が破綻しないことは別の能力だという指摘で、ロールプレイAIの「強さ」は1本のランキングだけでは測れないという結果になっている。
もっと見る
コンテンツ補助への批判を見ていると、 ・弱者の保護と強者の推進 ・インフラ整備と個社の助成 ・非税金での出資(CJ機構)と税金での補助 が混然となっていて論点がつかみにくい。 何にせよ、カネ出すなという意見である。 危惧するのは、政府には主要国並みに年1千億円予算を目指してもらっているものの、業界の支持はあっても、ユーザや国民から反対が多いと支援措置拡大は頓挫するということ。財務省と競合国は安堵する。 一方、同時に、 ・インディーに張れ ・AIに張れ ・ポケモンに張れ ・インフラに張れ といった声も増えてきたようだ。的確な意見も多い。効果の高いところに資金が向かうことを願います。
もっと見る
7兆ドル規模のAIブーム、勢いが衰えつつある チップなんて忘れて。コードなんて忘れて。 3兆ドル規模のAI革命において、最も高価で需要の高い商品は、特許取得済みのアルゴリズムでも、Nvidiaの新型GPUでもない。 それが電力だ。 具体的には、新しいデータセンターに1億~5億ドル相当の電力を供給できる、電力網への安全で高電圧な接続です。 現在、地球上で最大かつ最も裕福な企業――グーグル、マイクロソフト、アマゾン――は、エネルギーをめぐる前例のない世界的な争奪戦を繰り広げている。 彼らは、小規模な都市や巨大な製造工場、そして互いに競い合っている。その理由は、次世代のAIモデルを学習させるのに、小国1つ分の電力に相当する電力を消費してしまうからだ。 彼らは切羽詰まっている。割高な料金を支払っている。それにもかかわらず、地元の電力会社が自分たちの需要に見合う十分な容量の変圧器を設置するだけでも、4~5年も待たされているのだ。 これは技術的な問題ではありません。これは物理的なインフラのボトルネックです。 この1兆ドル規模の危機に対する一つの解決策が、デジタル世界の最も予想外で、しばしば嘲笑の的となってきた分野、すなわちビットコインマイナーたちから浮上してきた。 具体的には、数年前から、暗号資産の過酷な経済状況の中で生き残る唯一の方法は「エネルギー貴族」になることだと悟っていた、ごく少数の賢く冷酷な実務家たちである。 今日、こうしたマイナーたち……かつての「ワイルド・ウェスト」的なデジタル・ゴールドラッシュの参加者たち……は、AIハイパースケーラーたちが切望している、大規模でネットワーク化され、電力網への接続が可能なインフラを保有する、世界で数少ないプレイヤーの一角を占めている。 彼らはスイッチを切り替え、新たなAI大家へと変貌を遂げつつある。 そして、そのうちの1人がつい先ほど、正式に発表した。 5月5日、Bitzero (NASDAQ: AIBZ) は、シンガポールに拠点を置くOneQode社と、ノルウェーのデータセンター施設における15年間・110MWのリース契約に関する拘束力のある意向書に署名した。本契約の期間中、契約総収益は約26億ドルに達すると見込まれている。 これは単なる予測ではありません。野心という名目をかぶせたプレスリリースでもありません。5大陸に30カ所以上のデータセンターを運営する、世界的なクラウドおよびネットワークインフラプロバイダーによる、署名済みの法的拘束力のある確約なのです。 そして、これは業界全体の価格体系を一新しかねないという説の概念実証でもある。 このシンプルでレバレッジの高い転換点を見逃せば、今後10年間にわたるAIインフラブームを最大限に活用する、最も純粋で収益性の高い機会を逃すことになります。 なぜ大手テック企業は追いつけないのか あなたがGoogleだと想像してみてください。インディアナ州で110億ドル規模のデータセンター建設計画を発表します。資金もあります。土地もあります。政治的な支持もあります。未来を築く準備は万端です。 そして、地元の都市計画委員会が7対0で反対の採決を下した。 プロジェクトは頓挫する。 なぜでしょうか? それは、住民たちが騒音や振動、そして膨大な電力消費を懸念しているからです。 これが現実だ。データセンターは、いわば「新しい石油精製所」である。それらは人気がなく、膨大なエネルギーを消費し、地域社会からの激しい反対にさらされている。 ゴールドマン・サックスによると、世界のデータセンターの電力消費量は、この10年の終わりまでに最大165%も急増する見込みだ。既存の電力網は、そもそもこのような需要に対応できるようには設計されていない。高圧送電線をアップグレードするには数年と数億ドルを要し、規制や政治的な難題を乗り越えるにはさらに多大なコストがかかる。 いくらお金をかけても、どんなに高性能なチップを使っても、どれほど優れたAIアルゴリズムを用いても、この現実世界の問題を解決することはできない。 権力争いは今や非常に激化しており、その結果: • 新規参入者には上限が設けられています: ノルウェーのような電力市場では、既存のインフラを持たない新規データセンター事業者は、現在、初期割り当てがわずか5 MWに制限されており、事業を開始するにはかろうじて足りる程度である。 • 待機リストは数年にも及ぶ: 不可欠な高圧機器(遮断器、変圧器)の平均リードタイムは、たとえ資金があっても、現在4~5年となっています。 • 政治リスクは極めて高い: インディアナ州の事例が示すように、たった一つの地方計画委員会が、気まぐれで10億ドル規模のプロジェクトを頓挫させてしまうことがある。 メガワット規模のインフラをゼロから構築する機会はすでに失われてしまった。今日、AIデータセンターのブームに参入する唯一の方法は、すでに接続環境を保有している企業を買収、合併、あるいは提携することである。 これは、Bitzeroがすでに解決した、数十億ドル規模のジレンマです。 ある鉱山労働者が電力危機の解決にどう取り組んでいるか Bitzero (NASDAQ: AIBZ)は運が良かったわけではない……彼らは賢かったのだ。 数年前、同業他社が最新のASICの購入や短期のホスティング契約の締結に注力していた頃、Bitzeroはただ一つのことに注力していました。それは、自社でユーティリティとなることでした。 業界全体では、ビットコイン1枚を採掘するための総コストは平均で約10万ドルですが、Bitzeroのコストは驚くほど低い5万ドルにとどまっています。 そして、それは単なる幸運な偶然ではなかった。 これは、彼らがスカンジナビアの低コストエネルギー回廊に築き上げた、かけがえのないインフラによる競争優位性の結果である。 彼らの競争優位性を示す、単純かつ衝撃的な計算式は次の通りです: 1. 4.3¢/kWhという電力の秘密 Bitzeroは、ノルウェーにおいて132 kV(高電圧)レベルの認可を受けた送電網事業者です。 彼らは自社の高圧送電線を所有している。 彼らは独自の変電所を所有している。 彼らは水力発電所と直接接続を維持している。 つまり、彼らは電力会社を完全に迂回しているのです。手数料や仲介業者による中間マージンを排除しています。こうして、1キロワット時あたりわずか4.3セントという、驚くほど安い「すべて込み」の電気料金を実現しているのです。 米国や欧州の主要なデータセンター運営企業の多くは、1kWhあたり8~12セントを支払っています。Bitzeroは、その半額で電力を供給しています。 この所有構造こそが、同社のビジネスモデル全体の鍵となっている。事業拡大を図る際、同社は電力会社に申請書を提出して何年も待つようなことはしない。発電所と直接取引を行うのだ。これにより、現在ビッグテック企業を苦しめているリードタイムのリスクを排除できる。 2. 1ギガワットのAI対応ランウェイ Bitzeroは、単一の鉱山を建設しただけではありません。同社は、潜在的な発電容量が1ギガワットを超える、世界規模で複数の拠点からなるインフラ基盤を確立しました。 資産 容量 競争上の優位性 「AI大家」の戦略 ノルウェーのフラッグシップ 最大325MW OneQode社との間で、110MWの15年間の契約が締結された。契約期間中の総収益は約26億ドル。発電原価は1kWhあたり4.3セントの水力発電による。 拘束力のある書簡が送達された。「AI大家」説の最初のドミノが倒れた。 フィンランドのフラッグシップ 最大1GW 100%再生可能エネルギー。技術的デューデリジェンスにより、400kV接続で520MWの潜在能力が確認された。 AIハイパースケーラーの夢。大規模でクリーンな欧州のAIワークロードとデータ主権に最適化されています。 ノースダコタ・バンカー 最大300MW 225,000平方フィートの、電磁パルス(EMP)対策および核攻撃対策が施されたバンカー。人里離れた場所に位置し、膨大な発電能力を秘めている。 セキュリティ対策。機密性の高いコンピューティング処理、防衛関連企業、および極秘のAIデータに最適です。 これらの資産は有形であり、所有権があり、長年にわたる参入障壁によって守られています。 競合他社がフィンランドで1GW規模の原子力・水力発電所を、明日にも簡単に建設できるわけではない。認可手続きだけでも10年はかかるだろう。Bitzeroはすでに主要な設備を所有している。 3. スリムで効率的、そして利益を生み出すマシン Bitzeroは電力コストが安いだけでなく、人件費も抑えられます。 競合他社が従業員20~30人で40MWの施設を運営しているのに対し、Bitzeroはわずか4~6人でノルウェーの40MWの施設を運営している。 高度なソフトウェアがすべての発電設備を監視し、問題を自動的に修正するとともに、人的介入が必要な場合にのみ少人数のスタッフに通知します。このスリムな運用体制により、G&Aコストは事実上ゼロにまで削減され、発電容量1メガワットあたりのEBITDAマージンが拡大します。 このコスト管理体制と低コストの電力とが相まって、Bitzeroは、OneQodeとの契約による収益が計上される前から、現在のマイニング事業だけで月間約100万ドルのEBITDAを生み出すことが可能となっている。 ここから得られる重要な教訓は、コストこそが究極の競争力であるということです。ビットコインの採掘コストが5万ドルであるのに対し、競合他社のコストが10万ドルであれば、相場が暴落しても生き残ることができ、強気相場では巨額の利益を上げることができます。これこそが、レバレッジの高い投資の定義なのです。 ピボットの仕組み 「AI大家」モデルの魅力は、その本質的なオプション性にある。 ビットコインマイナーを稼働させるために必要な電力インフラ、変電所、および高圧接続は、AIサーバー(GPU)のクラスターを運用するために必要なものとほぼ同じです。 Bitzeroは、ビットコインとAIのどちらかを選ばなければならないわけではありません。その両方をこなすことができるのです: • ビットコインが上昇したときは: 同社は、急増する利益を確実に獲得するため、ビットコインのマイニングに最大限の電力を投入している。 • AIの方が報酬が高い場合: ハイパースケーラーが複数年契約の高利益率のホスティング契約を提示すると、Bitzeroはマイニング用リソースをAI演算用へと振り向ける。 ビットコインのマイニングは、AI大家ビジネスにおいて以下の3つの重要な役割を果たしています: • 収益源: 現在、AI関連の事業が構築され、パートナーシップの確保が進められている一方で、すでに数百万の収益を生み出しています。投資家の資金を無駄に消費する必要はありません。 • インフラストラクチャの検証: 24時間365日体制でコンピューティング負荷を稼働させ続けていることは、インフラが極めて堅牢で信頼性が高いことを証明しており、これは複数年契約を検討しているハイパースケーラーにとって不可欠な要素です。 • 究極のヘッジ: これにより、インフラが遊休状態になることを防ぎ、最初のAI顧客が契約を結ぶ前から、収益とコストの回収を確実に保証します。 「力」こそが製品そのものです。ビットコインのマイニングはキャッシュフローを生み出す原動力であり、AIホスティングこそが最大の成果です。 26億ドルの検証 理論には限界がある。結局のところ、誰かが小切手を切らなければならないのだ。 5月5日、OneQodeは26億ドルの出資を約束した。 拘束力のある意向書には、ナムスコガンにあるBitzeroのノルウェー旗艦施設における初期容量110MW全量について、15年間のリース契約が盛り込まれている。OneQodeは、この110MW全量にわたって大規模なGPU導入を段階的に実施する計画であり、2027年上半期の稼働開始を目指している。 これは、ハイパースケーラーが他の地域で直面している3~5年の建設期間よりもはるかに速いペースであり、これはBitzeroがすでに送電網への接続設備、変電所、そして敷地そのものを所有しているという事実が直接的な要因となっている。 経済的な要因こそが、同社にとって今が飛躍的な転換点となる理由です: • 契約期間中の総収益は、年間3%の価格改定分および顧客が負担する転嫁されるエネルギーコストを除き、約26億ドルとなる。 • 予想される当サイトの純営業利益率は85%であり、これはフル稼働時の年間純営業利益(NOI)が約1億5,100万ドルとなることを意味する。 • Bitzeroは、リース契約の仕組み上、光熱費を負担しないため、間接費を最小限に抑え、収益の大部分をそのまま純利益に反映させることができます。 BitzeroのCEO、モハメッド・バカシュワイン氏は、このLOIを同社にとって「決定的なマイルストーン」と位置づけ、OneQodeとのリース契約は「まさに、この施設を通じて支援したいと考えていた、大規模かつ高性能な顧客ニーズを体現するものとなる」と述べた。 訳:その戦略は功を奏している。 デューデリジェンス、規制当局の承認、データホールの設計合意、およびIGによる与信支援を条件として、60日から90日以内に最終的な賃貸借契約が締結される見通しです。契約締結後、Bitzeroは施設全体の建設を委託する予定です。このプロジェクトの総工費は11億ドルと見積もられており、同社は借入金によって資金を調達する計画です。すでに複数の銀行や金融機関との最終段階の協議が進められており、AIグレードの施設向けダイレクト・トゥ・チップ冷却、UPSシステム、HVACの分野で業界をリードする、最高水準のサプライチェーン、請負業者、エンジニアリングパートナーがこれを支えています。 稼働開始まで、ビットコインのマイニングは現場で収益性を維持しながら稼働し続け、変圧器の設置、詳細設計の完了、そして建設工事の開始が進む間もキャッシュフローを生み出し続けます。利益率の高いAIテナントが引き継ぐまで、マイナーたちが施設の運営を支え、収益をもたらし続けているのです。 すべてが予定通りに進めば、2027年第3四半期にも全量の納入が開始される見込みです。 「ミスター・ワンダフル」からの認定 このユニークなレバレッジに気づいているのは、あなただけではありません。 戦略的投資家であるケビン・オリアリー氏――『シャーク・タンク』の「ミスター・ワンダフル」――は、規律ある資産配分を行う投資家であり、インフラ投資の理論を深く信奉しているため、Bitzero社そのものにも戦略的投資家として出資している。 ハイリスクな投機を避けることで知られるオリアリー氏は、同社が自身の投資理論と完全に合致していることから、公に同社を支持している。 「ビットコインを保有するのなら、それを実現するための『ツルハシやシャベル』も手に入れてみてはどうでしょう? それこそが力であり、エネルギーであり、データセンターなのです。Bitzeroは、そのすべての条件を満たしています。」 彼はこれを「ビットコインとAIの両方に対する『ピック・アンド・ショベル』戦略」と呼んでいる。 世界で最も懐疑的かつ成功を収めているベンチャー投資家の1人が、ある企業が地球上で最も急成長している2つの産業におけるエネルギー問題を解決したと述べれば、その戦略的合理性は自明である。OneQodeの買収により、その価値は26億ドルと評価された。 長くは続かない評価額の乖離 ここで、投資の根拠が重要になってきます。 Bitzeroは現在、次のような企業となっています: • 最初の110MWについて、OneQode社との間で15年間、総額26億ドルのAIホスティングリース契約を締結した。 • フィンランドとノースダコタ州全域で、1ギガワット以上の追加潜在発電容量を確保した。 • 競合他社が追随するには何年もかかる、かけがえのないインフラの「堀」を築き上げた。 • データセンターの建設が進む間、キャッシュフローのつなぎとして、収益性の高いビットコインマイニングを継続した。 市場がまだ完全には織り込んでいない計算は以下の通りです。 AIホスティング分野では、現在、GPU対応の契約容量100MWごとに、約20億~30億ドルの企業価値に相当しています。Applied Digital(ナスダック:APLD)は、CoreWeave社と15年間で総額約70億ドルに相当する250MWの契約を締結した後、契約規模を400MW、総契約収益を約110億ドルへと拡大し、その過程で同社の株式価値評価全体を見直した。 Bitzero (NASDAQ: AIBZ)は、110MWの契約を締結したばかりだ。これは、ノルウェーの拠点だけで、22億~33億ドルに相当する企業価値を示唆するものであり、これには、1GWのフィンランド・キャンパスや、今後計画されている300MWのノースダコタ・バンカーは含まれていない。 はい、通常、最初の施設が完全に建設され、引き渡されるまでは、市場ではおよそ30%のディスカウントが適用されます。しかし、それが完了すると(2027年第3四半期を予定)、そのディスカウントは解消され、企業は、同様の投資テーマに基づきすでに数十億ドルの評価額で取引されている同業他社を基準に、再評価される傾向があります: • アイリス・エナジー(IREN): 21ドル以上。時価総額5十億。 • コア・サイエンティフィック(CORZ): $以上9十億。 • TeraWulf (WULF): $以上12.25 billion. これらの企業は、確保された拡張能力を備えた自社所有の電力インフラという、同じ中核的なコンセプトに基づいて企業価値を築き上げてきました。Bitzeroは、同様の成長余地と優れたコスト構造を有しているだけでなく、現段階では他社がまだ持っていない、AIリースに関する署名済みかつ法的拘束力のある契約書も手に入れています。 市場では、Bitzeroは単なるビットコインマイナーとして評価されてきました。しかし実際には、同社は1ギガワットを超えるAI対応の低コストでクリーンな電力を保有するインフラ事業者であり、そのうち最初の110MWについてはすでに契約が成立しています。 AIのエコシステム全体では、すでにソフトウェアやサイバーセキュリティの分野で、大きな成功を収めている企業が数多く現れています。CrowdStrike Holdings Inc. (NASDAQ:CRWD)、 Palantir Technologies Inc. (NASDAQ:PLTR)、およびSnowflake Inc. (NYSE:SNOW)といった企業は、AI駆動型のソフトウェア、アナリティクス、およびエンタープライズインフラに対する需要の急増から恩恵を受けています。しかし、投資家の注目は主にアプリケーション、データ、セキュリティに集まっている一方で、あらゆるAIワークロードは最終的には物理的な電力とデータセンターの容量に依存しています。AIの導入が加速する中、この業界における最大の制約はソフトウェアの革新ではなく、電力供給されたインフラへのアクセスである可能性があり、次世代のAIコンピューティングを支えるために必要な電力、用地、送電網接続を供給できる企業を中心とした、並行する投資テーマが生まれています。 評価額の格差は甚大です。Bitzeroが単にデジタル資産をマイニングしているのではなく、将来のコンピューティングの鍵を貸し出しているということを市場が完全に理解すれば、この格差は解消されるでしょう。 インフラの整備が完了しました。電力供給も確保されました。最初のAIテナントとの契約が締結されました。 選択肢は明らかだ。今すぐ参入してこの融合の波に乗るか、それともビッグテックがようやく資金力で参入してくるまで2年間待つか、だ。 憶測を巡らせる時期は終わった。希少でかけがえのない資産――電源プラグ――を手に入れるのは、今こそだ。 文:マイケル・スコット AIブームをきっかけに、天然ガスや電力関連株が予想外かつ前例のない上昇局面を迎えています。データセンターのエネルギー需要に注目していなければ、この10年で最大のエネルギー関連の話題を見逃してしまうでしょう。賢明な投資家はすでに、1兆ドル規模のAIシステムを支える準備が整っている数少ない企業へと、ひっそりと資金を移し始めています。
もっと見る
AIにコンピュータシステムのこと色々と聞いているんですけど、今のところclaude(課金)が、デフォルトでも欲しいレベルの回答をくれていい感じ。無課金Geminiはポンコツだし、もっと上のモデルになると、あれ?ずいぶん知的レベルが高いな……ってなって話が噛み合わなくなる(私が置いてかれる)
もっと見る
非エンジニアのPMが、AIを駆使してエンジニアばりのプルリクエストを出してくる。このリポジトリにはまだSKILLSやハーネスの整備が追いついていないのに。 無邪気に巨大なPRを出してくるとかも一切なく、適切な粒度で分割している。 AIに過去のPRを取得させて「小さく分割して出す」作法を把握したとのこと。 パフォーマンスについても考慮されており、N+1を避ける実装ができていた。 たぶん本人は「N+1」という概念自体はわかってない。 だけど、「何かしらここにはパフォーマンス上の問題があって、こう書くと避けられる」というところまではAIとの対話で辿り着いていたみたい。 地頭がよくて仕事ができる人なら、AIを駆使することで、かなり高い水準までこなせるようになったんだなと肌で感じる。 こういうシゴデキの非エンジニアになら、下手するとエンジニアも喰われかねない気がしてきた。 というか、もはや新種のエンジニアなのかもしれないな。呼称が分からないけど。
もっと見る
ウィスコンシン大学マディソン校とUCサンタバーバラ校の研究チームが、複数のAIエージェント同士が協力する場面で「探索」がうまく機能していないことを示す論文を発表した(https://arxiv[.]org/pdf/2607.11250)。 まず単純な設定で確かめている。1つのAIエージェントに、成功確率60%のピアAと50%のピアBのどちらかへ作業を繰り返し委任させる「2本腕バンディット」問題(手持ちの選択肢を試行錯誤しながら良い方に絞り込んでいく、探索と活用のトレードオフを扱う古典的な意思決定問題)を50ラウンド行わせた。理想的には最初は両方を試しつつ、徐々に成功率の高いピアAへ寄せていくのが正解になる。ところがQwen2.5-7B、GPT-4、GPT-5のいずれも、最初の数ラウンドでどちらか一方に固定してしまい、そのまま50ラウンド動かなくなる「早すぎる決め打ち」を起こした。比較用に置いた古典的な探索アルゴリズムUCB1(不確実性の高い選択肢を楽観的に評価し、試行回数を自然に分散させる手法)はきちんと両方を試しながら徐々に絞り込んでおり、対照的だった。 著者らはこれを「マルチエージェント探索問題」として定式化し、部分観測確率ゲーム(POSG、各プレイヤーが相手の能力や状態を完全には観測できないまま、同時に意思決定を繰り返すゲーム理論の枠組み)としてモデル化した。興味深いのが、エージェントに「探索と活用のバランスを取れ」とプロンプトで明示的に指示するだけの手法(In-Context Exploration)が、複数の文書をまたいで証拠を集めないと解けない質問応答ベンチマークHotpotQAを使い10体のエージェントに文脈を分担させた設定では、ランダムにピアを選ぶより成績が悪くなったことだ。プロンプトで頼むだけでは探索は直らず、構造的な仕組みが要ることを示している。モデルの種類が異なる4体(GPT-5、Qwen2.5-7B、Llama3.1-8B、Mistral-7B)を混ぜ、大学院レベルの専門知識を問う難しい選択式ベンチマークGPQAで解かせた実験でも同じ傾向が出た。最も強いはずのGPT-5でさえ、297回の相互作用のうち294回をQwen2.5-7Bに固定し、他のエージェントをほとんど試さなかった。 そこで著者らが提案するのがMACE(Multi-Agent Contextual Exploration)。各エージェントの選択を文脈付きバンディット問題として扱い、ピアの回答が自分と違うか(応答の多様性)、他のピアと比べて特徴的か(ピア間の異質性)、過去の成績はどうか、といった関係性を特徴量にしてLinUCB(不確実性ボーナス付きで期待報酬を推定する手法)でピアを選ばせる。HotpotQAで学習したパラメータを、追加学習なしで別の質問応答ベンチマーク2WikiMultihopQAに転用しても全ベースラインを上回った。理論面では、MACEの累積後悔(最適な選択との差の総和)がO(√(T log T))に収まる一方、探索しない貪欲な方策はΩ(δT)の後悔を負うと示されており、δはエージェント間の能力差の大きさを表す。エージェントが多様であるほど、探索の価値は際限なく大きくなる計算だ。 個々のモデルの賢さを積み上げても、「誰に何を聞くか」を決める仕組みが伴わなければ組織としての精度は頭打ちになる、という指摘として読める。
もっと見る
音声キーボードとしてTypeless(無料)とAquaVoice(課金)を併用してます。 Typelessは無料版でも8000語の無料枠が付いてくるのでいいですね😊 ただ、なんとなく直感があり、思い立って、Typelessも課金してみました。(Typelessの課金は年契約以外は高いです🥲) === 結果、すごくいい! 有料版は、無料版に比べ・・・ 1) 反応速度(音声をテキストにする速度)が無料版より体感できるほど早い 2) 適当にしゃべり散らしても、AIの要約と整形が精度高い(あとから手動で修正することはほぼない) 両方とも似たようなサービスだとは思うのですが、両方を課金して条件を揃えて比べたところ、少なくとも今の時点では、Typelessが勝ちだな。と思いました。 AquaVoiceは次の課金タイミングまでには解約します。 #Typeless#
もっと見る
風速の記録です。真ん中あたりが正午で左右に3時間ずつ。午前中18.7m/sの最大瞬間風速があり、たぶんそこで30度、時計方向にアンテナが回りました。AIに「これからの風向を調べて戻る可能性が一番高い方向をダメ元でいいから教えて」と聞き、その方向にセットして奇跡を待っているところです😂
もっと見る
モデル自身に長い文章の中から使えそうな部分を選ばせてから、その部分だけで一時的に学習させる手法をMeta AIとバージニア大学が発表した(https://arxiv[.]org/html/2607.09415v1)。 近年のLLM(大規模言語モデル)は数十万トークンの長文を一度に読めるようになったが、扱える入力の長さ(コンテキストウィンドウ)を広げるだけでは長文を有効に使えるとは限らない。入力が長くなるほど正解率が下がる現象が知られていて、質問に関連する証拠を見つけて使う能力がボトルネックになっている。 有望な解決策がテスト時学習(TTT、Test-Time Trainingの略)だ。答える前にテスト入力そのものを訓練データとしてモデルの重みを一時的に更新する手法で、長文脈タスクとの相性が良いとされてきた。ただし長文脈全体を学習に使うのは計算コストが高く、ランダムに抜き出した断片を使うと無関係な情報がノイズになる。 著者らはLLMの長文読解力を測るベンチマーク「LongBench-v2」で診断実験を行い、興味深い結果を得た。ランダムな断片で学習させるとベースモデルの正解率40.4%が38.9%まで下がる一方、正解を教えられたうえで判断するGPT-5.5が選んだ「本当に必要な部分」だけで学習させると45.9%まで伸びた。TTTの効果は学習させる部分の質に強く依存している。 これを受けて提案されたのがSelf-Guided TTT(S-TTT)だ。2段階構成で、まずモデル自身に長文脈の中から質問に関連しそうな部分を原文のまま抜き出させ(Stage 1)、その部分だけを使って次単語予測(次にくる単語を当てさせる、通常のAI学習と同じ方式)で一時的に学習させる(Stage 2)。最終的な回答生成は元の文脈全体を見て行う。 Qwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方で検証したところ、ベースモデルは一貫して上回り、ランダムに断片を選ぶ手法や文脈全体を使う手法など既存のTTT手法に対しても総じて上回るか同等の成績を残した。最大では15%の相対的な改善を達成している(Qwen3-4B-Thinking-2507、LongBench-v2の64k〜128kトークン帯域で正解率30.7%→35.3%)。 パープレキシティ(次単語の予測しにくさ)やエントロピー(予測の不確実性)が高い部分を選ぶより、モデル自身が「質問に関連しているか」で選ぶ方が明確に優れていた点も興味深い。難しい部分を学ばせればいいわけではなく、質問との関連性を見極める判断力そのものが効いているらしい。
もっと見る