登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Coherent
Coherent コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Coherent を含む検索結果
LLMは数学の問題で人間より高い正解率を出せるようになりました。でもそれは「きちんと積み上げて理解している」からでしょうか? タイトル: Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory URL: ❓ LLMは前提知識をきちんと積み上げて正解しているの? 💡 正解率自体は人間79.6%に対しLLM最高92.5%(Qwen3-80B)と上回りますが、前提を完全に満たした上での正解の割合は人間72.7%に対しLLMは48.16%にとどまります。正解していても土台が抜けているケースが多いということです。 ❓ 前提知識をヒントとして教えてあげれば改善する? 💡 実は前提に基づくヒントを与えても、無関係な例を与えた場合とほとんど差が出ませんでした。構造的な前提推論ではなく、表層的なパターンマッチングに頼っている可能性が高いです。 ❓ 賢いモデル同士なら、似たような知識の持ち方をしているはず? 💡 人間の学習者グループ間では知識の重なりが0.9以上と高いのに対し、LLM同士では0.38〜0.6程度しか重なりません。強いモデルほど人間から離れていく傾向も見られました。 ❓ つまりこの研究が示しているのは? 💡 精度という指標だけでは、LLMの「理解の仕方」のズレは見抜けないということです。知識空間理論という新しい評価レンズを使うことで、正解率の裏にある断片的な知識構造が浮かび上がります。 #LLM評価# #数学的推論#
もっと見る
🧩来年後半まで生産枠が埋まった会社が、複数の長期購入契約に署名せずにいる | 大口1社で埋めると他の客が来なくなる $AAOI 品薄の部品メーカーが大口顧客と三年、四年の購入契約を結ぶ。普通は好材料として発表される。買い手が確約した証拠だからだ。 Applied Optoelectronics $AAOI は、その契約書を複数、机に載せたまま署名していない。 8月18日、Rosenblatt の年次技術サミットで、CFO兼CSOの Stefan Murry は長期契約(LTA)をいずれ結ぶのかと問われた。結ぶつもりはある、と答えてから、慎重に構えている理由をこう説明した。 > 大きすぎる1社とLTAを結んで生産枠を埋めてしまうと、他の顧客が我々を使えるリソースとして見なくなる懸念がある > (Stefan Murry, Chief Financial Officer and Chief Strategy Officer) 同じ答えの中で、彼は「LTAには代償がある。こちらも何かを差し出している」とも言った。何を差し出すのかは言っていない。ただ、避けたいものの方は名指しした。将来こちらから取りにいきたい顧客が離れることだ。 供給が足りない局面で、部品メーカーの資産は生産能力そのものだけではない。まだ声をかけていない顧客から「頼めば作ってもらえる会社」に見えていることも資産になる。三年四年の枠を1社で埋めれば、それは他社の名前が入った順番待ちに変わる。 司会は踏み込んだ。別のハイパースケーラーが来て、御社のレーザーと米国生産で大量に買いたいと言ったら、迎え入れるのか、断るのか。 > 正直なところ、いまは難しい > (Stefan Murry, Chief Financial Officer and Chief Strategy Officer) こちらは実際に断る側の答えだ。理由は需要ではなく、約束しすぎないためだという。既存の顧客への納入を守れなくなることが一番避けたい、と Murry は続けた。生産枠は来年後半まで、そしてその先まで埋まっている。 数字を置くと、この慎重さの重さが見える。4〜6月期の売上は1億9,192万ドル。うちデータセンターが1億766万ドルで56%を占める。1年前の同じ四半期は4,479万ドルだったから、2.4倍に伸びた部分だ。それでもこの四半期のGAAP営業損益は2,473万ドルの赤字だった。 まだ営業段階で黒字化していない会社が、複数年ぶんの発注をすぐには受け取らずにいる。 小ささは言い訳ではなく、この判断の理由そのものになっている。「我々はこの業界ではまだ比較的小さい」と Murry は言う。同じ光部品でも Lumentum $LITE や Coherent $COHR は売上の規模が違うから、1社との契約が全体に占める比率も変わる。AAOI 側の主張では、300〜400ミリワット級の高出力レーザーの設計と仕様は Lumentum、Coherent、Broadcom と同等以上で、差は技術ではなく量産する力にあるという。 値段の話もしている。地政学とサプライチェーンの安全を理由に、顧客は米国生産に割増を払う用意がある、というのが会社の説明だ。レーザーの製造は全量が米国内、トランシーバーの組み立ては台湾と米国に分かれている。 長期契約の発表は、需要の強さの証拠として読まれてきた。ここでは、まだ署名されていないことがその証拠になっている。 ただし、その強気は損益にはまだ出ていない。8月6日の決算発表によれば、4〜6月期の非GAAP粗利率は29.8%で、1年前の30.4%から下がった。7〜9月期の会社見通しは売上2億5,500万〜2億9,000万ドル、非GAAP粗利率29〜30.5%。売り切れで、米国生産に割増が乗り、顧客を選べる立場だと説明する会社が、自分の粗利率をほぼ横ばいに置いている。 11月5日の決算で見るのはそこだ。枠の希少さが値段に変わるなら、この横ばいの見通しは保守的すぎたことになる。変わらなければ、選べることの価値はいまのところ交渉のカードであって、利益ではない。 株価は52週高値233.67ドルに対して126.34ドル。サミット当日以降の値動きは同じ週の光関連全体の下げと切り分けられないので、この論点を市場が織り込んだかどうかの材料にはならない。 契約を結べる会社と、結ばずにいられる会社は違う。この業界でいま数えるべきなのは受注の総額ではなく、誰が署名を先延ばしにできるかだ。 🤘情報提供 Stock Slayer :
もっと見る
🎬 「見た目はリアルでも、タスクを達成できているか?」——ビデオ生成の評価がついに結果志向へ進化します。 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 💡 概要 参照画像から「料理を作る」「植物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再現には長けていますが「最終状態をきちんと達成できているか」の評価が欠けていました。SemComp-Bench は6ドメイン・1,273件のデータセットと、VLM(Doubao-Seed-1.8)を用いた二軸評価フレームワークを導入し、この盲点を埋めます。 ⚠️ 解決する課題 既存ベンチマークは外観の一致性や中間手順を重視し、「タスクの結果達成」と「参照画像との意味論的整合性の維持」を同時に評価する基準がありませんでした。 🔬 評価フレームワーク:2つの独立した次元 ・OA(Outcome Achievement)スコア: 結果実現・意味論的グラウンディング・エンティティ一貫性・視覚的連続性の4基準をすべて通過することが必要 ・GR(Generation Reliability)スコア: 物理的整合性・視覚明瞭度・アーティファクト欠如など5基準の平均 📊 実験結果(詳細指示での成績) ・OA最高: HunyuanVideo-1.5-720P が37.8%(最高でも4割未満) ・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%(4位) ・T2V(テキストのみ)のOAはわずか0.6〜5.0%: 視覚的参照が不可欠 ・最大のボトルネック: Within-Scene Spatiotemporal Coherence(0.328〜0.739) → OAとGRは独立した能力であり、「綺麗に生成できる」ことと「タスクを達成できる」ことは別問題です。 #動画生成# #ベンチマーク#
もっと見る