𝗢𝗽𝗲𝗻-𝘀𝗼𝘂𝗿𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮-𝗩𝗶𝘀𝗶𝗼𝗻-7𝗕-𝗠𝗼𝗧 — 𝗼𝗻𝗲 𝗺𝗼𝗱𝗲𝗹, 𝗮𝗹𝗹 𝗺𝗮𝗷𝗼𝗿 𝘃𝗶𝘀𝗶𝗼𝗻 𝘁𝗮𝘀𝗸𝘀.
Reimagines CV as multimodal generation. Steerable by language or visual prompts. 𝗡𝗼 𝘁𝗮𝘀𝗸-𝘀𝗽𝗲𝗰𝗶𝗳𝗶𝗰 𝗵𝗲𝗮𝗱𝘀 — 𝘀𝘁𝗶𝗹𝗹 𝗦𝗢𝗧𝗔, 𝘀𝘂𝗿𝗽𝗮𝘀𝘀𝗶𝗻𝗴 𝗚𝗼𝗼𝗴𝗹𝗲 𝗗𝗲𝗲𝗽𝗠𝗶𝗻𝗱'𝘀 𝗩𝗶𝘀𝗶𝗼𝗻 𝗕𝗮𝗻𝗮𝗻𝗮 𝗼𝗻 𝘀𝗲𝗴𝗺𝗲𝗻𝘁𝗮𝘁𝗶𝗼𝗻 𝗮𝗻𝗱 𝗱𝗲𝗻𝘀𝗲 𝗴𝗲𝗼𝗺𝗲𝘁𝗿𝘆.
📊 𝘃𝘀. 𝗩𝗶𝘀𝗶𝗼𝗻 𝗕𝗮𝗻𝗮𝗻𝗮 (𝗚𝗼𝗼𝗴𝗹𝗲 𝗗𝗲𝗲𝗽𝗠𝗶𝗻𝗱):
🔹Referring segmentation (RefCOCOg cIoU): 80.3 vs 73.8
🔹Semantic segmentation (Cityscapes mIoU): 71.2 vs 69.9
🔹Depth estimation (NYUv2 δ1): 98.1 vs 94.8
🔹Surface normal (NYUv2 mean error): 14.4 vs 17.8
Built on a decade of SenseTime's CV leadership — #
1# in China's Vision AI market for 10 consecutive years, and named a Tech Innovator in global GenAI CV by Gartner. 𝗩𝗶𝘀𝗶𝗼𝗻, 𝗻𝗼𝘄 𝗻𝗮𝘁𝗶𝘃𝗲 𝘁𝗼 𝗳𝗼𝘂𝗻𝗱𝗮𝘁𝗶𝗼𝗻 𝗺𝗼𝗱𝗲𝗹𝘀. New tasks, defined by instruction — not by new model heads.