登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ファインチューニング
ファインチューニング コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ファインチューニング を含む検索結果
特定のタスクでは、強化学習でファインチューニングしたSLMが、最新のLLMを上回っているよという内容。メモメモ。 ・Ramp社のデータによると、AI投資の上位企業は3年間で収益が2倍以上に成長 ・一方、AI支出がゼロの企業はわずか15%の成長にとどまっている ・成功している企業の共通点は、AIの知能を自社で所有していること ・その成功の定石となっているのが、オープンモデルと強化学習の組み合わせ ・最新モデルで作ったデータを用い、自社の業務プロセスを模した環境で学習させる ・BridgewaterやHarveyなども、この手法で最新モデルを上回る成果を出した ・筆者らはeコマースのカタログ審査タスクを用いて、この手法を実際に検証した ・約500ドルと数日のGPU稼働で、9BのオープンモデルをGRPOで強化学習 ・結果として、9Bのモデル(Qwen3.5)がGPT-5.5などの最新モデルのスコアを上回った ・品質だけでなく、推論コストの面でも圧倒的な差が生まれている ・最新モデルのAPIは1,000件の処理に34ドルのコストがかかる ・しかし、自社モデルなら同じ処理がわずか0.50ドルで済む ・大手eコマースの処理量で換算すると、年間5億ドルのコストが700万ドルになる計算 ・汎用モデルは毎回ゼロから背景を推論するため、プロンプトの指示には限界がある ・自社モデルなら、タスク固有の知識を重みとしてモデル内部に保持できる ・正誤の検証が可能で、かつ高頻度で実行されるタスクはファインチューニングが最適 ・ただ、まれにしか発生しないタスクは最新モデルのAPIを借りる方が適している
もっと見る
【動画公開】 公式YouTubeチャンネル「さくらのデジタルインフラ学校」にてショート動画を公開しました🌸 LLM?RAG?ファインチューニング?💻 AIを基礎から実践までしっかり学びたいと思ったときは… チャンネル登録・動画への高評価、お待ちしております♪
もっと見る
毎日数十億トークンのトレースを、フロンティアLLMで評価するのはコスト的に無理がありました💸 小型オープンモデルのファインチューニングで、同等精度を10〜100倍安く実現した事例です。 タイトル: Building a 100x Cheaper Trace Judge with Fireworks URL: 💸 概要 LangChain LabsがFireworksと連携し、エージェントのトレースに対する「Perceived Error(知覚されたエラー)」検出器を構築した事例です。ユーザーが「間違い」や「修正が必要」と感じたケースを、小型のオープンモデルで検出します。 ❓ 解決する課題 LangSmithは本番トレースを通じて日次で数十億トークンを処理しています。 ・これらをフロンティアの大規模LLMで評価すると、規模が大きすぎてコストが非現実的になります ・「フロンティア級の性能を保ちつつ、全トレースから重要なシグナルをコスト効率よく抽出できるか」が問いでした 💡 方法論と提案手法 ・オープンソースのQwen-3.5-35Bを、Fireworks基盤上でLoRAによる教師ありファインチューニング(SFT) ・訓練データは2つの本番データセット:chat-langchain(技術Q&A・707例)とFleet(ノーコードエージェント・727例) ・「Perceived Error」を学習し、巨大なフロンティアモデルに頼らず評価をこなします 📊 実験結果 ・精度:ファインチューニングしたQwenがフロンティアモデルと同等以上(chat-langchainで96.1%、ドメイン横断のFleetで90.8%) ・コスト:トレース量に応じてフロンティアより10〜100倍安い ・転移性:chat-langchainで訓練したモデルが、再訓練なしでFleetでも全フロンティアモデルを上回る #LLM評価# #ファインチューニング#
もっと見る
本番で貯まったエージェントのログ、ただ眺めて終わっていませんか?そのデータを専用モデルに変える仕組みがLangSmithに加わりました。 タイトル: Introducing LangSmith Fine-Tuning URL: ❓ LangSmith Fine-Tuningとは何ですか? 本番のエージェント実行トレースを、独自インフラを組まずにファインチューニング済みモデルへ変換する `smithtune` CLIです。データセット作成・学習・評価・デプロイの4段階を一気通貫で扱えます。 ❓ どうやって学習データを作るのですか? LangSmithプロジェクトからメッセージやツール呼び出しの時系列(トラジェクトリ)を取得し、マルチエージェントのレビューでカスタムルーブリックに沿った高品質な事例だけを選別します。ツールの利用可能状態まで含めた正確な文脈を保存するのがポイントです。 ❓ 学習やデプロイはどう進めますか? LoRAによる教師ありファインチューニング(SFT)をFireworksやBasetenと連携して実行するため、GPUの用意は不要です。ベースモデルとの比較評価を経て、`smithtune deploy` でそのまま本番投入できます。 ❓ 効果はどれくらいありますか? 問題検知タスクではKimi K3がSFTでスコア90.0から96.0に向上。コードレビューでは同等以上の品質を保ちつつ、モデル呼び出しを29.8%、ツールリクエストを29.4%削減できました。 #LangSmith# #ファインチューニング#
もっと見る
便利だけど知られていないOpenAI APIの機能 📊 モデルの出力品質、人間がいちいち手動でチェックしていませんか? OpenAIの「Graders(グレーダー)」は、モデルの出力を自動で採点する仕組みです。Evalsでの品質評価や、強化ファインチューニングの報酬設計に使えます。 📌 タイトル:Graders(グレーダー) 🔗 URL: 🧩 概要 モデルの品質改善には「良い出力と悪い出力を定量的に判定する」仕組みが不可欠です。Gradersは出力に対してスコアを自動で付与する採点器で、文字列一致、モデルベースの判定、Pythonコードによるカスタム評価など、複数の採点方式に対応しています。Evalsの品質測定や、強化ファインチューニングの報酬関数として活用できます。 🛠 使い方 採点方式を選び、評価基準を定義します。文字列一致やラベル判定のような単純なものから、別のLLMを使った複雑な品質判定まで設定可能。定義したグレーダーはEvalsのパイプラインに組み込んだり、強化ファインチューニングの報酬として使ったりできます。 🏗 本番システムへの組み込み方 ・継続的品質モニタリング:本番のモデル出力をサンプリングし、グレーダーで自動スコアリング。品質低下を早期検知。 ・Evalsパイプライン:プロンプト変更やモデル更新時に、グレーダーで品質を定量比較。 ・強化ファインチューニング:グレーダーのスコアを報酬にしてモデルを強化学習的に改善。 ・A/Bテストの評価基盤:異なるプロンプトやモデルの出力をグレーダーで比較評価。 💡 ユースケース 📈 モデル出力の継続的品質モニタリング 🧪 Evalsでの定量的品質比較 🎯 強化ファインチューニングの報酬設計 🔬 プロンプト・モデルのA/Bテスト評価 ⚠️ 注意点 グレーダーの品質が評価の信頼性を左右します。特にモデルベースのグレーダーは、評価基準が曖昧だと採点がブレることがあります。明確で具体的な評価基準を定義し、人間の判断と比較してキャリブレーションすることが重要です。 ✨ 品質改善は「測れること」から始まる。まずはEvalsにグレーダーを組み込んで、出力品質の定量化を始めてみてください。 #OpenAI# #LLM#
もっと見る
【MONSTER SPORT ブレーキパッドのご紹介】 ㅤ モンスタースポーツでは多くのスズキ車向けに、様々な用途、車種に合わせたブレーキパッドをラインナップ。 人気のブレーキパッドをご紹介します! ㅤ ■type-S2 シリーズ 車種別に専用磨材を開発。テストを繰り返しながら特性を吟味してチューニングしたスポーツパッド。 ㅤ ■type-S1 シリーズ 低温低速域から高速域までコントローラブルなブレーキフィールへチューニングしたストリートパッド。 ㅤ ■type-e シリーズ 性能、ペダル剛性感を出すことにこだわると共に、人や環境に優しい原料を使用したファインチューニングパッド。 ㅤ 詳細はこちら!👉 ㅤ #monstersport# #モンスタースポーツ# #ブレーキパッド# #スズキ# #スイフトスポーツ# #アルトワークス#
もっと見る
ザッカーバーグの強権モードが発動中とはいえ、記事に該当しているエンジニアはキャリアを相当考えるだろうなぁ。 ・ザッカーバーグはモバイルOSの波に乗り遅れた過去があ李、AIという巨大なトレンドを絶対に逃さないという強い決意を持っている ・metaは過去にメタバースへ巨額の投資を行ったものの、パンデミック後に人々の関心が薄れ、その投資は十分な成果を上げなかった ・自社開発のAIであるLlamaモデルを進める中で2025年発表のLlama 4が不調に終わった ・そのため、AI戦略の立て直しを迫られた ・で、Scale AI社の株式を巨額で取得した。同社CEOのAlexandr Wang をAI戦略のトップとして迎え入れた ・Wangが得意とするのはAIの学習に必要なデータラベリングや、人間によるフィードバックを用いたモデルのファインチューニング ・彼の主導により、metaのエンジニアのタイピングやマウスクリックを強制的に監視してAIの学習データにするシステムが導入された ・この監視システムは事前の相談や拒否権なしにトップダウンで決定され、従業員のプライバシーに対する大きな懸念を引き起こした ・多くの反発を受けた会社側は、監視を一時停止する機能を追加するなどの妥協案を後日提示することになった ・同時期にプロダクト開発の中核を担うチームから30パーセントから50パーセントものエンジニアが、AIデータラベリング部門へ強制的に異動させられた ・meta社では従来、入社後に研修を経て自身の所属チームを自由に選べる文化があったため、この一方的な異動は大きな波紋を呼んだ ・異動先でのデータラベリング業務はAIが生成したコードをテストしてフィードバックを与える単調な作業 ・多くのエンジニアのやる気を削いでいる ・特にインフラストラクチャやセキュリティを担当するチームへの影響は深刻であり、優秀な人材が次々と本来の業務から引き剥がされた ・会社全体で10パーセントのレイオフが予告されたことで、一ヶ月にわたり従業員は自分が解雇されるかもしれないという強い不安にも苛まれていた ・metaの人事制度にて、自身の評価を相対的に高めるためにあらゆる指標を最大化しようとする政治的な動きが横行している ・新たな評価指標としてAIトークンの使用量が導入された ・なので、エンジニアたちは評価を上げるためだけに無意味にAIツールを多用し始めた ・人間による入念なコードレビューよりも、AIを使って表面的な生産性を高く見せかけることが自己保身の有効な手段となっている ・本質的なプロダクト開発がないがしろにされた結果、エンジニアたちは会社に嫌気がさし、外部の面接対策サービスの利用登録者が急増している ・不満を抱える中核メンバーを引き留めるために会社は特別ボーナスを支給した ・だが、それでも彼らの離職意欲を根本から削ぐには至っていない ・5月末には、オバマ元大統領などの著名人のInstagramアカウントが次々と乗っ取られるという、同社史上最も恥ずべき大規模な障害が発生 ・この障害はパスワードリセット時の本人認証プロセスが根本的に欠如しているという、非常に初歩的な脆弱性を突かれたものであった ・セキュリティチームの人員が半減させられていたことと、AIが生成したコードをAIがレビューするというずさんな開発体制が障害の最大の原因だろう ・障害発生の翌日には会社のCISOが辞任を表明 ・経営陣と現場との間に深刻な亀裂が生じていることがうかがえる ・社内の全体会議では、現状を強制収容所に例えて不満を爆発させる従業員が現れるなど、組織内の混乱はもはや隠しきれない状態になっている ・CPOでさえも現在のメタ社の状況を狂気(insanity of this company)と表現しており、経営トップが引き起こした社内環境の劣悪さを公式に認めている ・この一連の混乱の元凶は、既存の主力事業やエンジニアの尊厳よりも新しいAIモデルの開発を何よりも最優先とみなしたザッカーバーグの独断にある ・IT業界全体でも、AIの能力を過信してシステムの安全性を軽視する傾向が見られる ・これをAI psychosisと呼んで危惧する専門家の声が上がっている ・metaの広告ビジネス自体はAIの恩恵を受けて過去最高の収益を上げている ・だが、その基盤を支える組織を自ら破壊しているのは皮肉 ・エンジニアを単なるコストとみなす現在の経営体制が続く限り、優秀な人材の流出は避けられない ・他のテクノロジー企業にとっては絶好の狩場となっている
もっと見る
もし1回のフォワードパスで、まったく別の2つの文章を同時に「読み進められる」としたら。 Transformerは自己注意やMLPといった強い非線形の塊です。だから2つの文脈を1つの入力に混ぜてしまえば、出力はどちらとも無関係などこかに潰れてしまう、というのが自然な直感でした。 ところがこの論文は、その直感を覆します。2つの文章のトークン埋め込みを単純に平均して1本の入力として与えても、出てくる次トークン分布には両方の文脈の情報がはっきり残っていたのです。Pythia・Llama・Qwenなど複数のモデルで確かめたところ、正解トークンが上位10位以内に入るケースが30〜40%、上位100位まで広げると60〜65%にも達しました。 さらに興味深いのは、この「重ね合わせ」能力が学習で獲得されるのではなく、初期化直後が最も強く、事前学習が進むほど単調に弱まっていくという発見です。つまりアーキテクチャに内在する性質であり、事前学習データのわずか0.025%未満というごく軽いファインチューニングだけで、大きく回復させることもできました。この性質を使い、著者らは1回のフォワードパスから2つの独立した文章の続きを同時に生成する誘導デコード手法まで提案しています。 タイトル: Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs URL: #LLM# #Transformer#
もっと見る
動画生成AIが物を壁の後ろに隠すと、なぜか別の物になって出てくる。この「物体永続性」の欠陥に真正面から挑んだ研究です。 タイトル: Training Object Permanence in World Models URL: 📝 概要 人間の乳児が生後半年で獲得する「物体永続性」と「物体の固体性」を、動画生成モデルに学習させる取り組みです。150種の合成タスクから150万件の学習データと評価ベンチマークWROPを作り、160億パラメータのモデルPWM-WROPを構築しました。 ❓ 解決する課題 Sora等の動画生成モデルは、物体が遮蔽物の後ろで消えたまま別物として再出現したり、固体の壁を平気で貫通したりします。この欠陥が衝突や因果関係の推論全体を損なっていました。 💡 方法論と提案手法 Blenderで生成した150種のタスクを「遮蔽」「固体性」の6ファミリーに整理し、物体数や軌道などの構造パラメータは体系的に変え、色や照明などの表面パラメータはランダム化することで記憶による解答を防ぎます。これをCosmos3-Nanoにファインチューニングしました。 📊 実験結果 人間による361件のペア比較評価で、PWM-WROPは真の継続生成モデルの中で1位(Elo 1679.5)、次点に224ポイント差をつけました。静的遮蔽タスクでは全モデル中1位を獲得した一方、衝突などの固体性タスクでは苦戦が見られました。 🌍 ユースケース 学習データ・モデル重み・AWS Trainium2向けの学習基盤PWMを公開し、物理的に妥当な世界モデル構築の土台を提供します。 #世界モデル# #動画生成AI#
もっと見る
9ターンの会話が60個のメッセージに膨らむエージェントセッション、どこで問題が起きたか一目で追えますか? タイトル: Trajectories now in LangSmith: A readable view of every agent session URL: LangSmithに、スレッド内の全メッセージを時系列に並べ直して読みやすく見せる新機能「Trajectories」が追加されました。 注目ポイント 🔍 ネスト構造をなくした時系列ビュー サブエージェントへのハンドオフやツール呼び出し、リトライを含む複雑な実行トレースを、human・AI・toolのメッセージだけを時系列に並べた1本の流れとして提示します。ツールの無駄な再呼び出しなど、問題箇所を素早く発見できます。 👥 非エンジニアもレビューできるSME向け設計 医療の臨床問診エージェントや金融のコンプライアンス対応、サポートのエスカレーション判断などを、技術的なトレースを読まずに専門家がアノテーションキューでレビューできます。 🎓 ポストトレーニングデータとしての活用 高品質なトラジェクトリをそのまま教師ありファインチューニング用データとしてエクスポートでき、システムプロンプトからツール呼び出しまで本番の挙動をまるごと学習データ化できます。 エージェントのデバッグを、エンジニアだけでなく組織全体で担える民主化への一歩だと感じます。 #LangSmith# #AIエージェント#
もっと見る