登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 4→
4→ コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
4→ を含む検索結果
フォーカスMは4→2で▲30ちょいでしたー!十段ポーズした試合で勝たないため封印したのですが、言ってしまったのが最後。 まさかの藤島さんがカットイン。 この瞬間終わったと思ったし、当然ラスでした。 A1の壁は高かったです。 強くなって戻ってきます!
もっと見る
#ついっちみ# 2024→2025年! 年越し配信 はじめるよo̴̶̷᷄ ̫ o̴̶̷᷄
既刊「はにかみ彼女」1~4も追加生産しましたので、新刊「はにかみ彼女5」と合わせてよろしくお願いします! はにかみ彼女→ はにかみ彼女2→ はにかみ彼女3→ はにかみ彼女4→
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る
フジHD株主総会、出席者は昨年から3364→360人と大幅減 所要時間も2時間以上早まる