ð é·ãã³ã³ããã¹ããèªãAIã¯ãæ¬åœã¯ãã©ããèŠãã°ããããããã§ã«ç¥ã£ãŠããã®ã«ãæ¯ååŸåã«å
šéšèªã¿çŽããŠãããšãããã©ãã§ããããã
é·æã³ã³ããã¹ããæ±ãã¢ãã«ã¯ããã³ãŒãã®ãã³ã«å·šå€§ãªKVãã£ãã·ã¥å
šäœãã¹ãã£ã³ããŸããå®éã«Attentionãåãã®ã¯ããäžéšã®ããŒã¯ã³ã ããªã®ã«ãæ¢åã®ã¹ããŒã¹Attentionææ³ã¯ãããã¹ãããããšã«æ¢çŽ¢ãçŽãå¿
èŠããããæ¢çŽ¢èªäœãã³ã¹ãã«ãªã£ãŠããŸããã
KAIST AIãšGoogle DeepMindã®ç ç©¶ããŒã ã¯çºæ³ã転æãããã¢ãã«èªèº«ã«ãä»ã©ããèŠãŠããããèšèã§å®£èšãããã°ããããšèããŸãããããããDeclarative Attentionãã§ããã¢ãã«ã¯Chain-of-Thoughtã®äžã§ãã³ã³ããã¹ãå
šäœãèŠã
ãç¹å®ã®ç®æã ããèŠããçŽè¿ã®åºåã ããèŠããšããã¢ãŒããèªã宣èšããæšè«ãšã³ãžã³ãããããã®ãŸãŸAttentionãã¹ã¯ã«å€æããŸãã
é©ãã¹ãããšã«ãããã¯è¿œå åŠç¿ãªãã®ãŒãã·ã§ããã§æ©èœããŸãããGemma-4-31BãšQwen-3.6-27Bã§ã¯ãAttention察象ããŒã¯ã³ããããã52.0%ã»31.1%åæžããªããã粟床äœäžã¯ããã1ã3ãã€ã³ãã«åãŸã£ãŠããŸããã¢ãã«ã倧ãããã³ã³ããã¹ããé·ããªãã»ã©å¹æãå®å®ããæé·ã®ã±ãŒã¹ã§ã¯1åã®å¿çããã2,100äžããŒã¯ã³åãã®åæžã«ã€ãªãããŸããã
Language Models Can Control Their Own Attention
å¹çåãšè§£éå¯èœæ§ãåæã«å®çŸããã¢ãããŒããšããŠãé·ææšè«ãè¡ããšãŒãžã§ã³ãã®å®éçšã³ã¹ããäžããéµã«ãªãããã§ãã
#LLM# #Attention#