复杂 Agent 任务在后台跑,对话在前台继续。实时模型与 Core Agent,开始按两种节奏配合,带来全新的交互体验。
AI 助手正在进入一种新的工作节奏:一边对话,一边调用工具办事。近期关于 Gemini Live 更新的报道,就把后台工具调用放进了实时交互:助手可以先回应一句“我查一下”,再继续处理需要时间的工作。
这也把一个日常问题摆到了面前:查资料、做分析都需要时间,用户的新问题却随时会来。工具任务运行时,AI 还能不能继续接话?
要理解这件事,先要理解“全双工”。从用户视角看,传统语音助手更像对讲机:用户说完一段,AI 才能接话;AI 说话时,用户插话,往往会被打断或忽略。
全双工则类似于打电话:AI 可以边听、边说,用户能随时打断、补充,对话不再严格按“你说完—我再说”的回合推进。对用户最直接的变化,不是多了一个技术名词,而是等待感被压缩:不用等它说完,也不用迁就它的节奏。
WorkSwarm 全双工多模态能力正围绕这一体验展开。 openJiuwen 是由华为 2012 实验室、华为云、终端、计算、算力先遣队等团队联合高校、企业等广大开发者联合构建的开源 AI Agent 平台,WorkSwarm 即为其开源的办公编码统一工作台,它把实时音视频交互与 Core Agent 执行接入同一个任务:用户可以展示眼前画面、随时插话,也可以把需要进一步处理的工作交给 后台 Core Agent。
这套能力并非停留在演示层面,openJiuwen 提供了 Windows、Mac、HarmonyOS 等系统的一键安装包,进入官网下载安装,即可立即体验 能插话,才算实时对话 人和人交流,很少严格遵守“一方说完,另一方再开口”。看到新画面、发现理解偏了,或者只想先听重点,用户都会直接补上一句。
“先别介绍背景,直接说结论。这句话可以在 WorkSwarm 播报时说出来。
系统检测到新的有效人声后,会停止当前播报,开始处理新指令;已经生成的文字仍保留在任务记录里。语音活动检测与噪声门限,则用来降低背景声造成的误打断。
视频里我们让 Agent 先朗读《岳阳楼记》,在过程中直接语音说朗读《兰亭集序》,可以自然的快速切换。插话改变的是当前对话。
已经交给 Core Agent 的工具任务有独立的运行状态,要取消它,得单独去任务控制里手动停止。用户说话时,系统要同时处理两个层面的事:对话层接住新要求,任务层管好已经跑起来的工作。
用户插话时,当前播报停止;新的要求继续进入同一个任务,而不是另起一段割裂的对话。一边聊,一边办事 “这是什么品牌?
之后,用户可能还会补上一句:“查一下它的资料,整理成一份文档。一个看图问题,就这样变成了需要搜索、分析和文件生成的任务。
而资料还没查完,用户的新问题可能已经来了。 WorkSwarm 用两条路径接住这两种节奏:实时模型负责看画面、听要求、及时回应;Core Agent 负责拆解任务、调用工具,把后续工作推进下去。
搜索在后台运行,对话在前台继续。用户仍能追问眼前的画面,也能随时打断播报、补充要求。
当任务进入 Core Agent,页面会持续呈现任务状态、工具调用记录、执行结果和文件产物。用户看到的不再只是一个旋转的“加载中”,而是事情正在怎样向前推进。
视频中我们先下发了一个任务,让他通过工具调用,去阅读我们算法 word 文档,在这个过程中,我们可以在右上角任务队列看到任务正在运行,并且我们这个时候还能正常和 agent 聊天。在任务完成后,我们不会打断在聊天的对话,但是会先在文本框中输出我们的总结信息(如下图),然后在这一轮对话结束后,才会汇报工作,说总结文档的工作完成了,并且像人类汇报工作一样,提取重要信息说明,不会全部信息语音输出。
真实界面中,实时回答、Core Agent 运行状态和最终结果都回到同一个任务。边聊边办事,任务各走各的 前一个搜索还没结束,用户又交代了第二件事,怎么办?
WorkSwarm 的全双工任务队列,为后续要求安排了等待位置。用户可以调整顺序,把某项任务设为下一项;也可以停止等待中或正在执行的任务。
对话持续进行时,哪些事在做、哪些还没开始,都有明确状态。在右上角的我们可以手动移动每个任务的顺序,从而调度运行的队列,并且直接一键置顶、打断现有运行任务。
音视频连接与工具任务也分别管理。即使关闭全双工音视频,已经提交给 Core Agent 的任务仍可继续执行。
完成后的文字、工具结果和文件,会回到原来的对话中。例如,通过镜头发起品牌查询后,用户可以结束音视频交互,稍后再回来查看资料。
现场交代的工作,由此有了可追踪的执行过程。工具任务可以排队、调整和停止;音视频连接与后台任务不再被简单绑定。
所以,WorkSwarm 全双工多模态能力的意义,不只是让 AI 能“边听边说”,而是让实时对话与 Core Agent 的后台执行真正并行:用户在前台像聊天一样随时打断、追问、补充,复杂任务在后台按自己的节奏继续查资料、调工具、做分析。这种“对话不中断、任务不停跑”的体验已经走出演示,开始成为可用的协作方式。
当 AI 不再要求人迁就回合,而是像同事一样边聊边办,人机协同的下一段节奏,也就此开始。如何使用: 模型和语音通道可以在设置中配置 目前支持 JoyAI 协议和 Qwen Omni 协议,可以点击模型通道去切换 a)Qwen Omni realtime websocket 可以填官网 base_url 或者本地部署地址 JoyAI 是三种模型拼接(ASR, LLM, TTS)所以支持三种都使用官方 api,或者其他平台的 ASR 和 TTS 模型。
此外,还支持基于使用华为云 ModelArts 平台,基于 vLLM-Omni 推理框架,在昇腾系列 NPU 部署全双工多模态模型,对接 WorkSwarm 多模态全双工能力。参考资料: 在线体验,领免费 Token: /ai-market-guide/ 相关资源: 一键下载: /ai-market-guide/ GitHub: /ai-market-guide/ AtomGit: /ai-market-guide/ Agentic Hub: /ai-market-guide/ 使用华为云 ModelArts 在昇腾 NPU 部署全双工多模态模型参考: /ai-market-guide/ /ai-market-guide/