登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 まどめ
まどめ コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
まどめ を含む検索結果
新曲「ブルースター」 Music Video 公開いたしました‼️ #山本彩# #ブルースター# #まどめ# #madome#
【3ヶ月連続配信 第2弾】 「ブルースター」配信スタート🎉 🔻配信はこちら🔻 4月4日〜放送開始、アニメ『魔王の俺が奴隷エルフを嫁にしたんだが、どう愛でればいい?』エンディング楽曲✨ 🔻アニメ公式サイト🔻 #山本彩# #ブルースター# #まどめ#
もっと見る
【3ヶ月連続配信 第2弾】 「ブルースター」3月27日(水) 配信決定🎉 そしてそして‼️ 2024年4月スタートのアニメ『魔王の俺が奴隷エルフを嫁にしたんだが、どう愛でればいい?』のエンディング楽曲に決定いたしました✨ 🔻詳細はこちら🔻 #山本彩# #まどめ# #madome#
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る
Microsoftの研究チームが、画面を操作するAIエージェント(computer-use agent)を訓練するための合成環境「Echoverse」を発表した(https://arxiv[.]org/html/2607.28074v1)。 AIエージェントは、自分の操作が実際に何かを変化させる場でしか学習できない。でも本当に鍛えたい相手はメールや銀行、カルテのようにログインが必要で状態が刻々と変わる(stateful)アプリで、本物のサービスを壊すわけにはいかない。そこでデータベースごと丸ごと動く合成環境を代わりに使う。 これまでの手法はこうした合成環境を大量に作ることに力を入れてきたが、この論文は数より深さだと主張する。レシピサイトAllrecipesを模した環境で試したところ、浅い環境で訓練すると実際にベースモデルより性能が落ちてしまった。逆に、権限やエラー処理が本物通りに動き、最初の選択が後の展開を左右するような深い環境で訓練すると、同じドメインで性能が上がった。 合否判定にも工夫があり、スクリーンショットをAIに見せて「できていそうか」を判定させるのではなく、実際のデータベースの差分を正解データと突き合わせる「grounded grading」を採用している。エージェントが完了したふりをしても見抜ける仕組みだ。 結果、先ほど例に挙げたメールや銀行を再現したEchoMailやEchoBankなど10個の業務ドメインに、日付ピッカーなど特定の操作だけを鍛える2個の環境を加えた計12環境、2万1009本の実行履歴を使って90億パラメータのモデル(Qwen3.5-9Bベース)を訓練したところ、14項目の評価平均でベースモデルの36.5%から67.1%まで伸び、この訓練データを作った教師モデルGPT-5.4の80.7%まで14ポイント差に迫った。 面白いのは、EchoStay(民泊予約の模擬環境)で宿泊人数を指定する操作が正しく機能しないというバグを1つ直しただけで、それまで完了できなかった予約タスク24件のうち15件が新たに通るようになったこと。環境のバグ修正が、そのまま多数のタスク改善につながる。 さらにこの合成環境はそのまま強化学習の訓練場にもなる。正確にリセットでき、並列実行でき、報酬がデータベースの状態に基づくため信頼できるからだ。環境の数を増やすより、モデルが実際につまずく場所を見つけて環境ごと直し続けるループが効くという結論。
もっと見る
昨日マドメドさんとぱしゃり😻❤️‍🔥 むにちゃん💍 歌声が良すぎる好きすぎる〜〜 パフォーマンス最高で顔も良いのヤバ‼️ じゃむちゃん❤️‍🩹 ライブがはちゃめちゃかっこいいのに お話したらかわいすぎてギュンーー🤤💕
もっと見る
マニック・ストリート・プリーチャーズ、名盤『The Holy Bible』完全再現ライブが初音源化 2014年ロンドン公演を収録(写真 全2枚)