ECCV上,顶尖学者们开始研究如何让AI做生意了 一水 2026-09-10 18:17:46 来源: 量子位 多模态AI大牛轮番登台,全球64支团队组团解题 AI下一步往哪儿走,顶会往往最先露出风声。 9月8日至12日,ECCV 2026正在瑞典马尔默举行。
大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。作为计算机视觉顶会的ECCV,向来是前沿学术的竞技场,但今年,一个更贴近现实世界的技术命题被摆上了桌面: Agentic Commerce(智能体商业) 。
没听错吧?在一个纯CS视觉顶会上,一帮顶尖学者开始认真研究 如何让AI做生意 了。
镜头拉到MARS2 Workshop,台下座位早已坐满了人。台上星光熠熠,牛津、MIT、伦敦玛丽女王大学等机构的研究者轮番登场,聊的都是多模态AI正在攻克的前沿问题。
会场外的配套挑战赛也已决出优胜方案,10万美元奖金池,吸引64支全球团队入场,累计提交超过1060份方案。人气、阵容、奖金、议题热度,都拉满了。
把这些要素串在一起的,是一家中国科技公司: 钛动科技 。 △MARS2 Workshop优秀论文展示区 这场Workshop名叫MARS2,全称《Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond》(大模型时代的多模态推理与慢思考:迈向System 2及以上)。
它指向一个正在发生的现实:智能体商业正在改变消费者发现、比较、购买的完整交易链路。那么,当这条链路越来越多地由AI智能体参与甚至代理,多模态AI能否先看懂内容、理解意图,并据此优化商业动作?
根据ECCV官网公开信息,MARS2是本届ECCV全部Workshop中,唯一一个由中国科技公司牵头举办的Agentic Commerce方向的Workshop。所以,全球研究者们在MARS2 Workshop上,碰撞出了哪些「让AI做生意」的解法?
直击MARS2 Workshop现场 首先,判断一道题的学术分量,最快的方法是看台上坐着谁。那么,MARS2都有谁在?
我看到了这4个名字: 牛津大学教授Yarin Gal ,是现代贝叶斯深度学习的代表学者之一,领导牛津OATML实验室,长期研究AI给出的答案到底靠不靠谱。 MIT助理教授Paul Pu Liang ,同时任教于MIT Media Lab和EECS,带队研究多感官智能,专门解决文字、语音、视频等不同信息如何被模型放在一起理解的问题。
伦敦玛丽女王大学的Shanxin Yuan 主攻数字人与运动智能; 林雪平大学的Fahad Shahbaz Khan 长期研究视觉识别、视觉语言模型和多模态理解。能把这样一套阵容凑到同一张议程表上,MARS2的学术号召力,已经不用多解释了。
4位嘉宾的分享,共同指向多模态AI的下一步:不再只是「看见一段视频、说出几句描述」,而是能在复杂、动态、跨模态的信息中找到证据,理解事件如何发生、意图如何形成,并把判断转化为可靠行动。这条从「看见」到「想明白」的完整链路,恰好也是MARS2多模态AI挑战赛(MARS2 2026 Challenge)赛题设计的底层逻辑。
更具体地说,MARS2多模态AI挑战赛要回答这个问题: AI,能看懂营销视频吗?技术拆解来看其实就三层: 先看懂整条视频,再找到关键时刻,最后读懂背后的营销意图 。
这三层能力,也分别对应挑战赛设置的三条赛道。 △图片由AI生成 三条赛道共用的考卷叫M-CAR。
这是一个基于钛动科技真实商业场景构建的高质量数据集,包含3108支广告视频,覆盖30多种语言。总计36.5小时的视频被精细拆分为18198个语义片段,平均约7秒就有一个独立片段。
选手需要在本地让模型逐一答题,再把结果上传至EvalAI,由平台统一评分和排名。一番较量下来,最有意思的结果出现了 。
MAC最高分达到86.67,VTG和MDC的最高分则分别为62.27和63.53。从整体理解到精准定位和策略推理,冠军方案成绩相差20多分。
看来,看懂广告讲了什么,只是第一步;要在长视频中找准关键时刻、进一步拆解营销意图,仍是多模态AI更难啃的题。再把不同类型的模型拉到一起比比,也能看出明显的「偏科」。
作为对照基线的商用模型,在三个赛道中表现都比较稳;通用模型和任务专用模型则各有长短,其中任务专用模型在VTG赛道尤其突出。就是说,AI进了考场也讲究术业有专攻。
整体情况说完,再看谁把卷子答得最好。来自中国科学技术大学、南开大学、中山大学等知名高校的学者,以及来自字节跳动、京东、小红书等知名企业的代表纷纷参赛,最终,在MAC赛道,The Boys以86.67分拿下冠军;VTG赛道冠军是Ya PTers,成绩为62.27分;MDC赛道又被The Boys以63.53分收入囊中。
字节跳动背景的团队The Boys一支队伍拿下两个冠军和一个亚军,属实有点能打。 △竞赛团队背景分布图 而且这次参赛还有硬限制。
MAC和MDC使用的模型不能超过14B,VTG不能超过8B,并且只能使用开源权重。想靠巨型闭源模型硬压分数?
此路不通。选手只能在有限的模型体量里,把数据处理和推理方法往细了做。
(是时候展现真正的技术了.jpg) △钛动科技CTO Tracy Chen博士为获奖团队颁奖 这场挑战赛给学术界和产业界留下了三个关键信号。第一,它划清了当前多模态AI的能力边界 。
前面的成绩已经说明,模型看懂广告的大致内容问题不大,可一旦需要跨越多个片段,梳理时序关系、追溯前因后果,再作出商业判断,表现就会明显下滑。这正是从「System 1」感知走向「System 2」推理的距离。
说得更直白一点,AI已经会看广告了,但离真正看懂一门生意、参与商业决策,还有一段路要走。第二,它给出了一条性价比更高的优化路线 。
一般提到提升模型能力,大家最先想到的就是加参数,但这次的消融实验给出了一个有点反常识的结果。 VTG赛道有团队为模型补上一条跨模态「音频证据时间线」,把人声、音乐和其他声音发生的时间标出来,再与画面逐一对齐,模型定位精度直接提高了16.7分。
相比之下,参数量从4B扩展到8B反而-0.2分。这对产业界的提示很直接: 算力有限时,与其急着换更大的模型,不如先让模型听全、看全,再把信息对准。
第三,它给出了一套清晰的落地思路 。三个赛道的冠军方案用到了Proposer-Critic双模型验证、从粗到细的两阶段定位,以及按照视频时长来灵活分配模型处理的视觉信息量,虽然听上去技术名词不少,但核心逻辑就一句话: 让AI拿着证据回答问题 。
举个例子,现在要让AI判断一条广告是如何向消费者传达产品的核心卖点和实际价值,冠军方案不会让模型看完整条视频后,直接拍脑袋报一个答案。它会先快速扫一遍,构建镜头级、带时间戳的证据表征,由主模型生成答案;最后交给另一个模型独立进行证据一致性批判,抑制无证据支撑的幻觉输出。
视频越长、问题越复杂,系统还会相应多分配一些Token,让模型有足够空间处理信息。竞赛技术方案报告把这套思路概括为 「证据链工程」 。
这启发业界,模型有多大固然重要,但真正进入商业流程后,信息怎么组织、不同模态如何对齐、推理链路是否可靠,同样决定了AI到底能不能干活。比赛结束后,这些成果也不会只停在领奖台上。
赛事设计、评测结果和优胜方案已经整理成技术报告,相关评测基准与代码也会向研究社区开放(地址放文末了)。钛动科技CTO Tracy Chen博士认为,MARS2 Workshop的成功举办验证了一个判断——AI Agent正在从概念走向真实的商业场景,营销是少数既需要复杂智能、又能快速验证效果的领域之一。
钛动科技品牌公关VP张羽雪在闭幕致辞中也表示,MARS2 Workshop的讨论展现了前沿技术如何解决真实商业难题,而这正是钛动科技在国际顶尖学术会议组织讨论、举办挑战赛的目的。围绕多模态AI接下来该补什么、又该怎么补,答案如今更加具象化了。
为什么是钛动科技 聊到这儿,还有一个问题绕不过去。为什么钛动科技可以把Agentic Commerce的核心技术关切带进ECCV?
事实上,MARS2要回答的「AI能否看懂商业视频并理解营销意图」这个问题,钛动已经在真实业务中回答了近十年。从覆盖全球200多个国家和地区、服务10万+品牌出海、累计管理4亿+条广告策略、1400万个SPU的业务实践中,钛动积累了一套从「看懂」到「理解」的多模态能力,MARS2是钛动长期业务积累与多模态AI布局的一次自然延伸。
支撑这一步的积累,一头扎在真实业务里,一头长到了模型和技术上,现在又顺着Workshop走进了学术社区。业务这头,钛动2017年开始服务企业出海,每天琢磨的事都很具体: 帮中国公司去不同国家找用户、做内容、投广告,再把花出去的钱赚回来 。
一条广告上线,用户看了多久、在哪一帧划走、有没有点击和下单,后台很快就会给出结果。换个国家、换批用户,答案还可能完全不同。
这本身就是一道多模态题 。几十秒的视频里,画面、文案、音乐、产品和人物情绪挤在一起,共同影响用户最后买不买。
近10年来,钛动反复处理这些场景,也一点点摸清了什么内容、面对什么人、放到什么市场更有效。这些来自真实商业活动的反馈,又被持续沉淀为模型能够调用的营销知识,成了钛动继续往多模态模型层走的底子。
然后,就有了一款专门面向跨境营销的自研多模态模型, 钛极(Tec-Chi) 。钛极有多能打?
成绩已经摆上桌面。今年1月,钛极问答推理模型Tec-Chi-Think-1.0-32B,以85.82分登顶广告营销专业大模型测评榜SuperCLUE-Mkt。
大约半年后,钛极的内容理解模型Tec-Chi-VL-1.0-27B又在SuperCLUE-AdsVU出海营销视频理解测评中,以86.43分斩获总榜第二的成绩,与阿里巴巴千问Qwen3.7-Max-20260608共同位列榜单亚军。在营销这个专业领域,钛极大模型已经稳站全球前列。
不过成绩单背后,人们总是会关注更实际的问题: 它真能干活吗?营销多智能体平台Navos就此登场。
如果说钛极大模型负责看懂和想明白,那发布于WAIC 2026期间的Navos就是一个执行者: 它把散落在不同模型、工具和业务流程里的能力收进同一个入口,再按照企业目标调用不同的专业Agent,把AI真正放进市场洞察、内容生产、广告投放和效果优化等营销流程。 ?
?这不就是如今常见的「大模型+智能体平台」那套打法吗?
确实,方法论本质相同,真正拉开差距的是: 结果 。商业社会很残酷,但也很真实,一项技术只有让人真正赚到钱才有上桌的可能。
这方面,我翻到了一个挺有意思的案例。今年7月,钛动科技正式成为ChatGPT Ads全球首批官方技术合作伙伴,在ChatGPT Ads首批广告主定向邀请测试中,某出海品牌经过钛动AI技术团队优化,营销成本明显下降,ROI提升到了原来的2.5倍。
当然,一个案例只能说明这条路跑通过,能不能复制还得看更大的业务盘子。钛动招股书显示,2025年前三季度,其AI营销解决方案收入达到1.16亿美元,同比增长68.5%,占公司总收入的89.5%,同期净收入留存率达到132.5%。
翻译翻译,老客户整体留下来的同时,还在继续增加投入。到这里,钛动一直强调的「Useful AI」就不难理解了: 真实业务提出问题,数据和反馈进入模型,Agent把模型能力放进工作流,最后用商业结果验答案。
从数据到模型,再到应用和可以验证的商业价值,这条路,钛动已经在产业里跑了起来 。 MARS2所做的,就是把这套已经在商业战场跑起来的技术闭环进一步开放给全球研究者,让产业问题进入学术研究,再让研究成果回到产业接受验证。
回过头看,钛动科技能在ECCV牵头发起MARS2,一路都有迹可循。技术公司扎堆当「顶会出题人」,图什么?
另外你发现没,技术公司在顶会里的角色,已经悄悄变了。以前顶多派几个研究员去发发论文、做做报告,重在参与,现在不一样了—— 越来越多垂直赛道的头部技术公司,直接下场当起了「议程设置者」。
摇身一变,直接从交卷的人变成了出题的人? ?
国内这类消息我最近是没少刷到,转头一看国外,好嘛也一个样。 CVPR 2025的Embodied AI Workshop,组织者名单里就出现了NVIDIA、Meta、Apple、Microsoft、Adobe、Amazon等一串熟悉的名字。
同年的自动驾驶Workshop,还继续举办Waymo Open Dataset Challenge,把自动驾驶汽车在真实道路上遇到的问题,直接摆到全球研究者面前。没办法,谁让AI越往真实世界走,最难的问题就越容易出现在产业一线。
企业最先碰到问题,急着要答案,而研究者天天憋着新招,也急着找地方试。两边一拍即合,Workshop自然就成了碰头的地方。
钛动牵头MARS2,走的也是这条路 。招股书显示,2025年前三季度,钛动营收约1.30亿美元,同比增长74.5%,其中AI营销解决方案占总收入的89.5%,净利润达到5568万美元。
再把时间拉长,钛动已经连续三年保持超过82%的毛利率,账上现金储备超过4.4亿美元。这份商业成绩背后,是一个相当复杂的多模态业务现场。
不同市场、不同文化、不同用户,再加上画面、声音、文案和营销目标同时出现,随便拎出一项,都够多模态AI好好研究一番。 △钛动团队在MARS2 Workshop现场 所以它把问题搬进了MARS2,钛动出题,全球顶尖研究者带来新思路新方法,好的方案再回馈整个产业。
顺带着,全球AI人才也借这个机会,直接和产业一线接上了头。 Agentic Commerce方向的 「产学研连接器」 ,钛动把这个角色立住了。
再往深一层看,MARS2指向的,也是多模态AI接下来一个越来越清晰的方向: 回到真实商业场景里去 。过去比的是模型能不能看懂图片和视频,接下来要比的,是它能不能在不同语言、文化和商业目标交织的环境里,真正解决问题。
顶会开始讨论什么,往往预示着技术下一步会往哪里走。这一次,方向指向了真实商业世界。
而钛动科技,已经提前一步,把这道题摆上了桌面。完整报告: /ai-market-guide/
id=60wA5w8i5L 开源地址: /ai-market-guide/ 版权所有,未经授权不得以任何形式转载及使用,违者必究。钛动科技 一水 GPT-6带火循环Transformer,阿里早已布局 2026-09-05 实测星火X2.5:手搓粒子月亮、拆完61页财报……还顺手揪出了我的Bug 2026-09-10 刚刚,港股AGI第一股杀疯了!
Agent业务半年进账近5亿,Token收入Q2暴涨500% 2026-08-28 650亿美元! IPO前夕,Anthropic营收底牌曝光 2026-08-18 扫码分享至朋友圈