登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ALIGON
ALIGON コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ALIGON を含む検索結果
おさげツインテール
真剣な恋愛・結婚を支援するマッチングアプリヨイトキ(Yoitoki)、英語ユーザー向け新機能「Pre-Date Alignment」...
🧠 誤差逆伝播を使わない「生物学的に妥当な学習」が深いネットワークで失敗するのは、実は勾配のランク崩壊が原因でした。それを幾何学的な介入で解き、精度を1.4%から46.1%へ一気に引き上げた研究です。 タイトル: Overcoming Rank Collapse in Feedback Alignment URL: 📝 概要 フィードバックアラインメント(FA)は、誤差逆伝播に対する生物学的に妥当な代替手法です。順方向と同じ重みを逆方向にも使う「対称な重み転送」を必要とせず、固定のランダムなフィードバック重みで学習します。本論文は、FAが深い構造でスケールしない原因を「勾配のランク崩壊」と特定し、それを克服する手法を提案します。 ❓ 解決する課題 FAの誤差は、逆伝播に比べて著しくランクが低く、より低次元の部分空間に制約されてしまいます。このランク崩壊が、パラメータ空間の探索を大きく制限し、学習中に重みの整合(alignment)が進まなくなる根本原因でした。 💡 方法論と提案手法 勾配の次元性を高める、相補的な2つの機構を提案します。 ・Muonオプティマイザ:直交化に基づき、すべての特異値を1に設定します。モメンタム更新のスペクトルを平坦化し、これまで無視されていた方向を強調して、更新の幾何そのものを書き換えます ・バッチ正規化:隠れ層の活性を正規化して活性の直交性を促し、層をまたいで高次元の表現を維持します ・Muonは更新の幾何を均一化し、バッチ正規化は表現の次元性を保つ。両者を組み合わせると、学習を通じて豊かな学習方向が維持され、深いネットワークでもアラインメントが生まれます 🎯 ユースケース 逆伝播に依存しない学習や、脳に着想を得たニューロモルフィック計算、そして「最適化の軌跡の次元性」を扱う研究全般に役立ちます。 📊 実験結果 ・CIFAR-10・CIFAR-100・STL-10・Tiny ImageNetで、AlexNetとResNet-18を用いて評価しました ・CIFAR-100・ResNet-18では、ベースラインFAがわずか1.4%だったのに対し、FA+バッチ正規化で37.1%、FA+Muonで25.3%に向上しました ・FA+Muon+バッチ正規化で46.1%(バッチ正規化単独比で約9ポイント改善)を達成しました ・同様の改善が、すべてのデータセットとアーキテクチャで確認されました #DeepLearning# #Neuroscience#
もっと見る
🧊 1枚の画像から3Dを作るとき、「見えている面は正確だが裏側は作れない」か「完全だが入力とズレる」かの二択でした。World Tracingは、ピクセルごとに3D点を層状に積み上げて、見える面と隠れた面を同時に手に入れます。 タイトル: World Tracing: Generative Pixel-Aligned Geometry Beyond the Visible URL: 🔍 概要 World Tracingは、各ピクセルに対しカメラ空間の3D点を順序付きでL個積層する表現です。第0層が見える表面、深い層が前景の裏に隠れた面との前後交差を記録し、忠実な再構成と生成的な補完を1つの層状問題として統合します。 ❓ 解決する課題 従来のimage-to-3Dには根本的なトレードオフがありました。 ・深度推定器はピクセルに正確だが、見える表面で止まる ・生成3Dモデルは完全だが、正準座標で動くため入力とズレる World Tracingは「見える面を正確に再構成しつつ見えない面をもっともらしく生成する」忠実な生成として定式化します。 💡 方法論と提案手法 中核は17億パラメータの拡散トランスフォーマWT-DiTです。 ・層内・レイ方向・グローバルの3方向に因子化したアテンションで、深度順序と前後の整合を保つ ・第0層は画像に制約される再構成的、深い層は生成的という非対称性に対し、層ごとにノイズ量を変える混合ノイズスケジュールを導入 ・多層(3Dアセット)と単層(RGBD写真)の教師を同時に使える混合学習 🎯 ユースケース ・テキスト駆動の3Dシーン編集(ピクセル整列なので再学習なしのクローズドフォーム合成) ・完全な裏側形状をメモリに使う、ジオメトリ条件付きの新視点ビデオ生成 ・TRELLISと組み合わせ、入力に正しく再投影される忠実なメッシュ生成 📊 実験結果 オブジェクト・シーン・動的の各ベンチで既存手法を上回りました。 ・オブジェクト可視深度MAE 0.0149(VGGT 0.0257) ・完全形状F-score@0.05 0.549(TRELLIS 0.204) ・シーンMAE 0.0102、動的クリップChamfer L2 0.0105で最良 #3D生成# #CV#
もっと見る