ð¬ ãèŠãç®ã¯ãªã¢ã«ã§ããã¿ã¹ã¯ãéæã§ããŠãããïŒãââãããªçæã®è©äŸ¡ãã€ãã«çµæå¿åãžé²åããŸãã
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation
ð¡ æŠèŠ
åç
§ç»åãããæçãäœãããæ€ç©ãåªå®ããããªã©ã®ã¿ã¹ã¯ãéæãããããªãçæããéãæ¢åã¢ãã«ã¯æé ã®åçŸã«ã¯é·ããŠããŸãããæçµç¶æ
ããã¡ããšéæã§ããŠããããã®è©äŸ¡ãæ¬ ããŠããŸãããSemComp-Bench ã¯6ãã¡ã€ã³ã»1,273ä»¶ã®ããŒã¿ã»ãããšãVLMïŒDoubao-Seed-1.8ïŒãçšããäºè»žè©äŸ¡ãã¬ãŒã ã¯ãŒã¯ãå°å
¥ãããã®ç²ç¹ãåããŸãã
â ïž è§£æ±ºãã課é¡
æ¢åãã³ãããŒã¯ã¯å€èгã®äžèŽæ§ãäžéæé ãéèŠãããã¿ã¹ã¯ã®çµæéæããšãåç
§ç»åãšã®æå³è«çæŽåæ§ã®ç¶æããåæã«è©äŸ¡ããåºæºããããŸããã§ããã
ð¬ è©äŸ¡ãã¬ãŒã ã¯ãŒã¯ïŒ2ã€ã®ç¬ç«ããæ¬¡å
ã»OAïŒOutcome AchievementïŒã¹ã³ã¢: çµæå®çŸã»æå³è«çã°ã©ãŠã³ãã£ã³ã°ã»ãšã³ãã£ãã£äžè²«æ§ã»èŠèŠçé£ç¶æ§ã®4åºæºããã¹ãŠééããããšãå¿
èŠ
ã»GRïŒGeneration ReliabilityïŒã¹ã³ã¢: ç©ççæŽåæ§ã»èŠèŠæç床ã»ã¢ãŒãã£ãã¡ã¯ãæ¬ åŠãªã©5åºæºã®å¹³å
ð å®éšçµæïŒè©³çްæç€ºã§ã®æçžŸïŒ
ã»OAæé«: HunyuanVideo-1.5-720P ã37.8%ïŒæé«ã§ã4岿ªæºïŒ
ã»GRæé«: Seedance 2.0 ã91.8%ââã ãOAã¯20.0%ïŒ4äœïŒ
ã»T2VïŒããã¹ãã®ã¿ïŒã®OAã¯ããã0.6ã5.0%: èŠèŠçåç
§ãäžå¯æ¬
ã»æå€§ã®ããã«ããã¯: Within-Scene Spatiotemporal CoherenceïŒ0.328ã0.739ïŒ
â OAãšGRã¯ç¬ç«ããèœåã§ãããã綺éºã«çæã§ãããããšãšãã¿ã¹ã¯ãéæã§ãããããšã¯å¥åé¡ã§ãã
#
åç»çæ# #
ãã³ãããŒã¯#