# 云知声 > 港交所上市 (09678.HK) 云知声官方网站 ## 产品与服务 - [大模型](https://www.unisound.com/model) - [通用](https://www.unisound.com/model-general) - [U2 Flash](https://maas.unisound.com/models/u2-flash) (外部链接): U2 Flash 聚焦Agent 与 Coding核心场景,具备强大的复杂推理、代码生成与任务执行能力,支持长上下文,可胜任复杂工程开发、长程任务及多步骤Agent 工作流。在保持强劲模型能力的同时,实现更快的推理速度与更优的成本效率,为开发者与企业提供高性能、高性价比的智能底座。 - [Unisound U2](https://maas.unisound.com/models/u2) (外部链接): 通用大语言大模型 - [U2-ASR](https://maas.unisound.com/models/asr) (外部链接): 语音识别 - [U2-TTS](https://maas.unisound.com/models/tts) (外部链接): 语音合成 - [U2-TTS-Clone](https://maas.unisound.com/models/clone) (外部链接): 声音克隆 - [U2-TTS-Design](https://maas.unisound.com/models/design) (外部链接): 音色设计 - [U1-OCR](https://maas.unisound.com/models/ocr) (外部链接): 智能文档解析与抽取 - [医疗](https://www.unisound.com/model-medical) - [U2-Med](https://maas.unisound.com/models/insureMed) (外部链接): 医疗文本智能处理 - [U1-OCR-Med](https://maas.unisound.com/models/ocr-med) (外部链接): 医疗文书解析 - [Token Hub](https://www.unisound.com/token-hub) - [MaaS 平台](https://maas.unisound.com/) (外部链接) - [智算平台](https://www.unisound.com/shouya-maas) - [云知声 AI 智能网关](https://www.unisound.com/enterprise-ai-ops) - [AI 1.0 开放平台](https://ai.unisound.com/?channel=unisound) (外部链接) - [Agent Hub](https://www.unisound.com/agent-hub) - [Skill Hub](https://skill.unisound.com/) (外部链接) - [产品](https://www.unisound.com/agent-hub-product) - [U2 Agent](https://agent.unisound.com/) (外部链接) - [U2Claw](https://claw.unisound.com/) (外部链接) - [兽牙智能体平台](https://www.unisound.com/shouya-agent) - [智慧营销平台](https://www.unisound.com/intelligent-marketing) - [智慧客服平台](https://www.unisound.com/transport-cs) - [行业Agent](https://www.unisound.com/agent-hub-industry) - [智慧医疗 Agent](https://www.unisound.com/healthcare-medical) - [智慧保险 Agent](https://www.unisound.com/healthcare-commercial) - [智慧医保 Agent](https://www.unisound.com/healthcare-insurance) - [智慧座舱 Agent](https://www.unisound.com/intelligent-cockpit) - [数字员工 Agent](https://www.unisound.com/digital-employee) - [数字助理 Agent](https://www.unisound.com/digital-assistant) - [端侧智能](https://www.unisound.com/edge-ai) - [芯片应用开发平台](https://udp.hivoice.cn/solutionai?channel=unisound) (外部链接) - [智能硬件](https://www.unisound.com/intelligent-hardware) - [智聆降噪麦克风阵列](https://www.unisound.com/zhiling-voice-module) - [多模态智慧客服屏](https://www.unisound.com/ai-powered-multimodal-customer-service-display) - [兽牙语记](https://www.unisound.com/shouya-voicememo) - [兽牙端侧AI-HUB](https://www.unisound.com/shouya-edge-ai-hub) - [研究与学习](https://www.unisound.com/research): 探索 AI 前沿技术,发表学术论文与技术文章 - [论文博客](https://www.unisound.com/paper-blog) - [云知学院](/academy) (外部链接) - [政企AI人才培训](https://academy.unisound.com/home) (外部链接) - [院校AI教育合作](https://www.unisound.com/ai-education) - [中小学AI素养培养](https://www.unisound.com/k12-ai-literacy) - [OPC创新创业孵化](https://www.unisound.com/academy-opc) - [关于我们](https://www.unisound.com/about) - [公司介绍](https://www.unisound.com/about-company) - [新闻动态](https://www.unisound.com/news) - [加入我们](https://www.unisound.com/careers) - [投资者关系](https://ir.unisound.com/) (外部链接) ## 最新动态(正文全文) ### 云知声发布 U2-Flash:后训练×RSI 驱动,面向真实任务的新一代高性能模型正式登场 URL: https://www.unisound.com/research/158 发布时间: 2026-09-15 今天,云知声正式发布 U2-Flash。 它不是 U2 的效率精简版,而是一次面向真实生产力的全新主力智能形态的诞生。作为新一代高密度智能模型,U2-Flash 通过系统性后训练释放推理和自主执行能力,既有主力模型的硬核能力,又有 Flash 级别的极速响应,为真实生产力场景提供更强、更快、更省的综合解法。 相比其他大模型公司,云知声的独特优势在于:我们是一家具有10年以上场景沉淀的大模型公司。多年的真实业务打磨,让我们对场景的理解深度和数据积累厚度远超纯技术驱动的团队,也让U2-Flash从设计之初就深度贴合真实生产力的需求。 在能力构建方式上,U2-Flash 有两个鲜明立场:一是让模型 深度参与自身训练闭环的演进 ——从生成训练数据、分析轨迹到巡检修复训练系统——这是递归自我改进(RSI)方向的第一步实践,也是贯穿技术设计的主线;二是 让模型在隐藏状态空间中进行深度思考(Latent Reasoning) ,并将思考能力封装为用户可控的思考强度接口,而非不可观测的黑箱。 在架构上,U2-Flash 采用稀疏混合专家(MoE)设计,总参数约 266B ,但单次推理仅激活约 10B 参数(激活比例不到总参数的 4%),把编程、Agent、数学推理、指令遵循等多领域能力统一编码进同一套权重,用远小于同类模型的激活规模,撬动主力级的任务完成质量——其综合能力已可比肩市面上主力模型。而支撑这套架构能力充分释放的,正是系统性的后训练机制——它让模型从“能做事”进化到“会做事”。 01 更强:能力跃升,比肩主力模型 在真实业务场景中,模型能力的竞争已经从“能否回答问题”走向“能否完成复杂任务”。相较上一代 U2 模型,U2-Flash 实现了跨代式的全面跃升,在代码、Agent、高阶推理和办公自动化等核心场景中展现出压倒性的优势,并在多项权威基准测试中刷新纪录: 在代表编程能力的 DeepSWE v1.1 榜单中,U2-Flash 斩获 64.6 分,较上一代实现翻倍式增长,一举超过 GLM5.3-Flash、DeepSeek-V4-Pro-0813 等模型。在 TerminalBench 3.0 测试中飙升至 24.3 分,直接超越 K3 等万亿参数级别模型;在 SWE-Bench Pro 测试中更是交出 61.6 分的高分,较前代大幅跃升 10.5 分。 这些成绩意味着,以不到总参数4%的激活规模,U2-Flash展现出了与市面上主力模型相抗衡的综合能力。 02 更快:从“生成快”走向“任务完成快” 对于复杂工作流而言,单纯的 Token 生成速度只代表吞吐,端到端的整体解算周期才是决定效率的核心。 在速度维度,U2-Flash 实现了从单字响应到完整任务交付的全链路加速。模型首字响应(TTFT)平均控制在 3 秒 以内,峰值输出吞吐最高可达 300 tokens/s ;相较 U2 模型,U2-Flash 在 Agent 任务执行过程中减少 20%-30% 的迭代步数,任务执行周期缩短 35% ,真正做到了更快响应、更快生成、更快完成。 03 更省:让每一个 Token 都更有价值 面向高频真实任务,U2-Flash 进一步优化 Token 使用效率,减少复杂任务中的无效探索与冗余输出,让更多 Token 直接用于解决问题。相比上一代 U2 模型,U2-Flash 在复杂任务执行过程中可减少 20%-30% 的 Token 消耗,在提升任务完成效率的同时,进一步降低单任务使用成本。 这份“省”同样体现在架构层面:约 10B 的激活参数意味着每一次调用只需唤醒总参数中很小的一部分,推理成本与激活规模而非总参数规模线性锚定,这也是 U2-Flash 能够在保持主力级任务表现的同时,把单位推理成本控制在远低于同等能力模型的关键原因。 同时,U2-Flash 将编程、Agent、推理、工具调用和办公处理等多类能力汇聚于统一模型中。企业无需针对不同任务频繁切换和维护多套专用模型,从模型选型、接入和路由,到后续运维与迭代,都可以进一步降低系统复杂度与综合使用成本。 04 国产算力,也能跑出高性能 前沿智能不应被绑定在单一算力平台上,而应在多元异构算力环境中同样高效、稳定地释放。U2-Flash 围绕主流国产算力平台,从模型架构、核心算子、推理框架到集群调度持续适配优化,并针对不同硬件的计算、显存和通信特性做软硬件协同调优,降低迁移部署成本,提升推理效率与资源利用率。 在实际服务中,U2-Flash 在国产平台上的吞吐、时延、并发和集群扩展效率持续提升,与主流 GPU 差距不断缩小,部分场景已接近 NVIDIA GPU 方案。面向大规模推理、高并发和长上下文负载,U2-Flash 持续优化执行与调度机制,为政企、金融、制造、能源等行业的规模化部署提供更灵活的算力选择。 05 后训练×RSI 驱动:自主闭环演进释放高密度智能 后训练(Post-training),是 U2-Flash 释放高密度智能的核心引擎。面向复杂任务场景,单纯依靠模型规模扩张已难以满足能力持续提升的需求。U2-Flash 将后训练作为释放模型能力的关键抓手,通过系统性训练机制进一步强化模型的理解、规划与执行能力。 U2-Flash 建立了一套自主闭环演进机制。 模型能够深度参与任务生成、轨迹分析与纠错重采,通过强弱模型对比定位决定性动作,无需大量人工标注即可围绕薄弱环节持续迭代,目前已自主构建出覆盖主流编程语言、规模近 10 万的高质量 SWE 任务集。 更重要的是:云知声深耕行业十余年,积累了海量真实场景数据与高质量标注能力,这为后训练提供了不可替代的数据质量壁垒。好数据是好模型的第一性原理——正是多年沉淀的高质量数据,让U2-Flash的后训练效果远超纯规模驱动的方案。 在这套闭环下,多项底层技术创新共同释放了高密度智能: 在探索效率上, 异步 Agent RL 采用并行 Worker 沙盒执行与基于 GRPO 的策略优化,不阻塞策略更新;结合关键 Action 标记回溯成功与失败信号,攻克了长程信用分配难题,使单位时间有效训练轨迹数提升约 60%,并引导模型在推理时更快收敛至高价值路径。 在能力融合上,为解决多领域强化学习中的“跷跷板效应”, 多教师在线策略蒸馏 先训练数学、代码、Agent 等专项领域专家,再由学生模型实时生成轨迹,由教师逐 Token 动态打分蒸馏。这不仅使达到同等能力水平的训练步数减少约 55%,更让多种专业能力在单次推理中协同发挥,大幅提升了每个输出 Token 的能力密度。 在进化持续性上, 自适应动态任务生成 引入难度校准机制,动态匹配模型当前“只差一点”的能力边界,防止训练集被“刷穿”;同时,U2-Flash 将其 Agent 能力反哺至训练流程本身,实现自主巡检机器、修复与重启任务的全流程自我运维,保障训练闭环不间断高质运转。 这套闭环正是U2-Flash在递归自我改进(RSI)方向迈出的第一步:模型已能参与生成训练数据、分析纠正执行轨迹、巡检修复训练系统——不只是被训练的对象,而是训练闭环的参与者。但这仍是有边界、可验证、可追溯的自我改进:每次自主调整都发生在人工设定的沙盒环境与验证标准之内,验证优先于自证、可追溯优先于黑箱化。任何自我改进都必须先在真实沙盒中经可复现验证,只有在验证机制足够成熟后,才会逐步扩大模型参与自身能力成长的范围。 U2-Flash 现已正式上线云知声 MaaS 平台, 欢迎体验: https://maas.unisound.com/models/u2-flash ### 云知声技术论文入选语音顶刊 IEEE TASLP 2026,探索多语种 Speech-LLM 高效适配新路径 URL: https://www.unisound.com/news/156 发布时间: 2026-09-10 近日,云知声团队研究成果 Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition 成功被语音与语言处理领域顶级国际期刊 IEEE Transactions on Audio, Speech and Language Processing (IEEE TASLP 2026) 正式接收。 该成果直击语音大语言模型(Speech-LLM)多语种适配的行业痛点,破解了跨语言干扰与跨域知识迁移难以兼顾的核心难题,为数据资源不均衡场景下的多语种语音识别提供了全新高效的微调范式,同时为低资源语种语音大模型的规模化落地搭建了通用、可复用的技术底座。 IEEE TASLP由IEEE信号处理学会主办,是音频、语音与语言处理领域的顶级权威期刊,聚焦音频技术、语音处理、自然语言计算三大核心方向,收录全球高质量、高创新性的前沿学术成果,学术影响力与行业认可度位居领域顶尖水平。 入选论文核心信息 英文题目 :Zipper-LoRA: Dynamic Parameter Decoupling for Speech-LLM based Multilingual Speech Recognition 中文题目 :Zipper-LoRA:面向Speech-LLM多语种语音识别的动态参数解耦方法 作者团队 :Yuxiang Mei, Delai Qiu, Shengping Liu, Jiaen Liang, Yanhua Long 研究方向 :多语言自动语音识别、语音大语言模型(Speech-LLM)、低资源语种适配、参数高效微调(PEFT)、LoRA优化 论文简介 :面向资源分布不均衡的多语言自动语音识别任务,现有语音大语言模型在参数高效微调时面临跨语言干扰与知识迁移难以兼顾的问题:共享 LoRA 易受高资源语言主导,损害低资源语言性能;完全独立的 LoRA 则限制了跨语言知识共享。 针对这一问题,本文提出 Zipper-LoRA 动态参数解耦框架,将 LoRA 适配能力划分为共享子空间与语言特定子空间,并利用语言身份感知路由器在秩级别动态融合二者,实现对可迁移知识的细粒度共享和对语言冲突的有效隔离。本文进一步设计了静态、硬路由与软路由三种变体,以及采用 Initial-B warm-start 的两阶段训练策略,以提升不平衡多语言训练下的收敛稳定性。 实验结果表明,Zipper-LoRA 在 12 种目标语言上均取得了优异性能。与仅通过调整有效秩来实现压缩或效率优化的 FlyLoRA 等方法不同,Zipper-LoRA 所提出的动态参数解耦策略能够在保持跨语言知识共享的同时,有效缓解不同语言之间的参数干扰。同时,相比 Fully Shared 的 Vanilla-LoRA 和 Fully Decoupled 的 Independent-LoRA,Zipper-LoRA 在所有语言上均取得更加均衡的性能表现,验证了共享与语言特定知识动态融合的有效性。 Zipper-LoRA 结构图 不同 LoRA 方法在 12 种语言上的识别性能对比 论文链接: https://arxiv.org/abs/2603.17558 项目地址: https://github.com/YuCeong-May/Zipper-LoRA 从语音识别到Speech-LLM,持续探索语音大模型技术边界 作为国内早期布局智能语音赛道的企业,云知声在语音识别、语音合成、自然语言处理及大模型领域深耕多年,积累了深厚的技术壁垒与成熟的产业化经验。公司自研的U2语音大模型已支持超100种中国方言、15余种国际语种,广泛落地于医疗、教育、智能家居、智能车载等核心垂直场景,实现了多场景、多语种语音AI的规模化商用。 在Speech-LLM前沿领域,云知声持续深耕语音编码器与大语言模型的高效融合架构,不断突破端到端语音理解、语音生成核心技术,持续夯实多语种、低资源语音建模能力。 长期以来,云知声研发团队的创新成果持续登上ICASSP、Interspeech、ACL、EMNLP等国际顶级会议与期刊,在语音识别、声纹验证、语音增强、多语言大模型建模等领域拥有广泛的国际学术影响力。 本次成果获IEEE TASLP 2026录用,是对云知声技术实力与创新路径的又一次权威认可。未来,我们将坚持“强基模、深应用”的战略方向,持续迭代模型能力,推动语音大模型基础研究与产业应用深度融合,让更先进的语音AI技术走向更多语言、更多场景,服务于更广泛的真实应用。 ### 一封表扬信背后,云知声如何让AI走进审计一线 URL: https://www.unisound.com/news/155 发布时间: 2026-09-10 近日, 云知声收到中铁上海设计院集团有限公司(以下简称 "上铁院")发来的表扬信 。信中,上铁院对云知声团队在 "大模型云服务及智能体应用开发服务项目" 中的技术实力、项目交付与服务态度给予高度评价。 一封表扬信的背后,是云知声 AI 技术深入业务场景的真实实践。 作为大型综合性研究机构,上铁院的审计工作长期面临三大现实难题:历史审计报告、制度文件分散沉淀,查找依据耗时费力;文档审查依赖人工逐条比对,效率低、标准不一、容易遗漏;大量审计经验沉淀于个人,难以形成可持续复用的组织知识。这些问题的本质,是非结构化文档难理解、领域知识难沉淀、业务经验难复用。 针对这些痛点,云知声以 "整体规划+技术研发+知识工程+交付运维" 为主线,融合文档解析、知识图谱、RAG 检索增强、大模型与智能体等技术能力,为上铁院打造 "上铁智审" 审计智算平台 ,用四步让 AI 真正走进审计业务核心流程。 01 | 智能解析:让 "沉睡文档" 变成 "活知识" 审计资料多、格式杂、分散存储,"找得到" 不等于 "用得上"。云知声依托智能文档解析能力,对上铁院历年审计报告、制度文件、项目资料等进行统一解析,建设审计资料库、制度库和问题库。目前,平台已汇聚 2017—2026 年相关审计材料,沉淀制度文件 2000 余份、问题清单材料 200 余份,让分散的历史资料真正变成可检索、可关联、可复用的知识资产。 02 | 精准召回:让 "翻文件" 变成 "找答案" 面对海量制度文件和历史案例,审计人员过去往往需要反复翻阅、比对,才能找到对应依据。云知声构建面向审计场景的混合检索与多级重排能力,结合关键词检索、语义检索与审计知识图谱,实现制度、审查要点与历史问题的深度关联,让 AI 快速找到相关依据。 03 | 可证输出:让 AI 审查 "说得准",更 "证得出" 专业审计场景不仅要求 AI 给出结论,更要求结论有依据、过程可追溯。云知声通过 RAG、知识图谱与输出验证机制,让 AI 基于制度、案例和审查要点进行分析,并自动为审查结论关联制度编号、条款号和原文出处,形成完整证据链。目前,平台已形成委外合同 50 条、科研项目 30 条审查要点,相关验证项目准确率达到 80%—90%——AI 不仅会回答,更能够给出依据。 04 | 长文理解:让 "超长文档" 不再成为 AI 盲区 审计材料篇幅长、信息复杂,简单切分容易造成上下文割裂。云知声采用 "语义分段+因果 / 依赖链重组" 的方式,在拆解长文档的同时保留内容之间的关联关系,让 AI 既理解局部信息,也把握前后逻辑,真正 "读懂" 超长专业文档。 值得一提的是,不止于项目交付落地,双方还携手开展铁路行业重大科研课题联合攻关。云知声的大模型云服务与智能体开发能力,也正从单一项目交付走向更深层次的科研与业务创新赋能。 从"找资料" 到 "找依据",从 "人工核对" 到 "AI 审查",再到让历史经验沉淀为可复用的数字知识 —— 云知声正在让 AI 真正进入审计业务的核心流程。 ### 再获权威认可!云知声兽牙智能体平台入选北京工商联《首都民营经济科技创新和产业创新融合发展优秀案例》 URL: https://www.unisound.com/news/154 发布时间: 2026-09-03 近日,由北京市工商联主办的首都民营经济创新发展大会顺利举行。大会聚焦民营经济科技创新与产业创新深度融合,现场发布《首都民营经济科技创新和产业创新融合发展优秀案例》。凭借在AI技术创新与产业实践方面的持续探索,云知声 兽牙智能体平台 成功入选。 此前,兽牙智能体平台已入选工信部人工智能应用典型案例。此次再获北京市工商联认可,进一步体现了云知声在人工智能技术产业化、规模化落地方面的实践成果。 从“能回答”到“能执行”,AI真正进入业务流程 随着人工智能进入产业深度应用阶段,企业对AI的需求正从“模型能力”转向“业务价值”。 相比单纯提供问答、生成能力,企业更需要一套能够理解业务、连接数据、调用工具并完成任务闭环的智能化系统,让AI真正进入生产流程,成为可持续运营的生产力。 面向这一需求,云知声打造 兽牙智能体平台 ,构建覆盖“模型—数据—智能体—应用”的全链路产业AI能力,推动大模型从“被动响应”走向“主动执行”。 围绕企业AI从试点到规模应用的完整路径,平台进一步形成 产品底座—FDU交付—行业资产 三级递进体系,贯穿POC验证、项目交付、业务运营及后续持续迭代,帮助企业解决AI项目“能试验、难落地”“能上线、难持续”的实际问题。 三层能力体系,让AI从项目变成长期资产 在产品底层,兽牙智能体平台围绕企业级AI应用所需能力,构建安全托管、数据融合、低代码、自然交互、合规治理、消幻觉等基础能力,为智能体开发和运行提供统一底座。 企业无需从零搭建复杂的AI基础设施,即可基于业务需求快速构建应用,并在安全、可信、可控的环境中持续迭代。 在交付层,平台引入 FDU(Field Deployment Unit)持续交付模式 。 区别于传统“一次性交付”的项目模式,FDU贯穿技术验证、业务上线与长期运营全过程,根据实际业务反馈持续优化智能体能力,使AI应用能够伴随业务需求不断演进,将单次项目合作转化为持续价值创造。 在此基础上,平台进一步沉淀企业和行业的业务语义、领域知识、流程经验与项目实践,逐步形成可复用的 行业本体资产 。 这些资产可以在新的业务场景和项目中持续复用,让每一次项目落地不再从零开始,推动企业AI能力不断积累、迭代和放大。目前,平台客户留存率达到 70% ,持续运营与复用能力得到业务实践验证。 技术底座持续夯实,适配企业级应用需求 产业AI的规模化应用,离不开稳定、可靠的底层技术支撑。 目前,云知声在 多模态医疗垂类大模型、芯上端侧小模型精炼化、多模态情智兼备数字人 等核心技术方向持续布局,相关技术已通过权威鉴定并达到 国际领先水平 ,为兽牙智能体平台在复杂行业场景中的持续迭代提供技术基础。 同时,兽牙智能体平台已通过 华为昇腾Ascend Native应用开发技术认证 ,进一步验证了平台在国产AI软硬件生态中的兼容性、稳定性与成熟度,为企业在自主可控技术体系下部署智能体应用提供支撑。 从单点应用走向规模复制,释放产业AI价值 依托统一的平台能力与长期积累的行业经验,兽牙智能体平台目前已在 智慧医疗、智慧政务、轨道交通、智能座舱、金融医保 等多个领域落地应用。 在持续实践中,云知声正将不同项目中形成的技术能力、交付方法和行业知识不断沉淀、复用,让AI应用从单点试点逐步走向规模复制。 从模型到智能体,从技术验证到业务运营,人工智能产业正在进入更加关注“任务完成度”和“真实价值”的新阶段。 未来,云知声将继续围绕“强基模、深应用”推进技术创新与产业融合,持续完善兽牙智能体平台能力,将大模型、行业知识与真实业务流程深度结合,让AI真正成为企业可运营、可积累、可持续进化的生产力。 ### 云知声获评Wind ESG“A”级,综合表现位居信息技术服务行业前25% URL: https://www.unisound.com/news/153 发布时间: 2026-09-03 近日,Wind ESG最新评级结果发布, 云知声智能科技股份有限公司获评“A”级,ESG综合得分7.28分,在261家信息技术服务企业中排名第47位,高于信息技术服务行业均值6.17分。在信息技术服务行业261家公司中排名第47,位于行业前25%。 从综合得分构成看,管理实践部分和争议事件部分分别为4.28分和3.00分。在管理实践部分,环境、社会与治理维度得分分别为5.39、6.38和6.04,均高于各自行业平均水平,其中社会维度得分最高。 此次获评,是对云知声ESG综合表现的认可,也从外部评价体系进一步体现了公司在 技术创新、产业价值、企业治理与可持续发展 等方面的综合实力。 01 获评A级,长期发展能力再获认可 当人工智能加速从技术突破走向规模化应用,评价一家AI企业的标准,也正在不断拓展。 模型够不够强、业务增长够不够快之外,企业能否建立稳健的治理机制,能否持续创造产业与社会价值,能否在快速发展中守住安全、合规与责任边界,正成为衡量企业长期竞争力的重要维度。 Wind ESG评级正是观察企业可持续发展能力的重要体系之一。 Wind在深入研究国际标准和指南的基础上,结合中国企业ESG信息披露政策与资本市场实际情况,构建了中国公司ESG评级体系。目前,该体系已覆盖全部A股、港股上市公司以及公募信用债发债主体,并纳入 500余项管理实践指标和1200余个争议事件标签 ,综合考察企业在环境、社会、治理及风险事件等方面的表现。 在这一评价体系下,云知声此次获得 A级评级、7.28分综合得分,并位列信息技术服务行业47/261 。与此同时,公司环境、社会、治理三个维度得分均高于行业平均水平,体现出较为均衡的ESG综合表现。 这也意味着,在持续推进技术与业务发展的同时,云知声正不断夯实企业治理与可持续发展的基础。 02 从“技术向上”到“价值落地”,AI真正进入产业深处 对于人工智能企业而言,ESG并不是独立于业务之外的一套评价体系。 技术如何被研发、应用和治理,最终能否真正解决产业问题、提升运行效率、创造长期价值,本身就是AI企业责任与价值的重要组成部分。 围绕AI从底层能力走向产业应用的完整链路,云知声持续完善 “基座能力层—智能构建层—价值运行层”三层架构 ,让模型、智能体与业务系统之间形成更加紧密的连接。 在底层能力上,公司持续以U2为核心完善U-Model模型矩阵,不断提升通用基座模型能力,并向三医、语音、文档智能、医学影像等专业方向延伸,为智能体构建和行业应用提供更扎实的技术底座。 但技术突破并不是终点。 真正的价值,在于让智能走出模型、进入业务、创造结果。 围绕这一方向,云知声持续推动AI能力在三大核心业务板块落地:在 企业智能化服务 中,让智能体深入医疗、医保、交通、制造等真实业务流程,推动AI从单点能力走向行业化、规模化应用;在 Token原生业务 中,让模型能力以更高效、更灵活的方式被调用和使用,加速大模型能力转化为生产力;在 端侧AI 领域,则持续拓展智能硬件及全球市场,让AI能力从云端进一步延伸至更广泛的终端场景。 从底层模型,到智能体,再到真实业务,云知声正在持续打通: 模型 → 业务 → 行动 → 价值。 让更强的技术能力,真正转化为可落地、可复制、可持续的产业价值。 03 坚持“强基模、深应用”,走向更高质量的发展 人工智能进入产业深水区后,企业之间的竞争,已不再只是模型能力的竞争,而是逐步走向 技术、业务、治理与长期责任的综合竞争 。 此次Wind ESG“A”级评级,是对云知声现阶段综合表现的一次外部认可,也进一步印证了公司在技术创新与高质量发展之间持续构建平衡的方向。 面向未来,云知声将继续坚持“强基模、深应用”战略,持续迭代U2及三医、语音、文档智能、医学影像等模型能力,并依托“基座能力层—智能构建层—价值运行层”三层架构,不断提升智能体模块复用效率,推动AI能力向更多行业、更多区域实现规模化落地。 与此同时,公司也将持续完善企业治理与可持续发展体系,在追求技术突破与业务发展的同时,坚持安全、合规、可控的发展原则,让人工智能创造的不只是效率提升,更是更长期、更广泛的产业与社会价值。 ### 云知声2026上半年业绩:营收增长38.7%,Token业务同比激增760%,大模型商业化全面提速 URL: https://www.unisound.com/news/148 发布时间: 2026-08-28 8月28日,云知声(09678.HK)发布截至2026年6月30日止六个月的中期业绩 。 报告显示 ,公司上半年实现营业收入5.62亿元,同比增长38.7%,商业化进程全面提速。其中,Token业务收入同比增长约760%,业务毛利率超过60%,标志着云知声在AI大模型商业化道路上迈入加速期,正从技术领先迈向价值引领的新阶段。 战略聚焦三大块,估值逻辑向平台型迁移 2026年上半年,云知声战略聚焦企业智能化服务、token业务、端侧AI三大核心板块。新结构下,公司摆脱了传统AI项目交付商的标签,向AI平台型公司全面转型,AI创造的价值不再被传统业务稀释,估值逻辑实现根本性跃迁。 分业务来看,三大核心板块均实现稳健增长: 企业智能化服务 :包含智能体应用,智能体平台和行业解决方案三大板块,共实现收入4.78亿元,同比增长35.7%,持续巩固行业领先地位。 Token业务 :实现收入近3000万元,二季度环比增长超500%,成为公司新的增长引擎。 端侧AI业务 :实现收入5380万元,同比增长9.2%;芯片海外出货量同比提升50%,增长韧性十足。 经营质量方面, 今年上半年,公司复购收入占比超过60%,客单价显著提升,老客户复购、增购进一步支撑收入增长。报告期内,公司行政开支锐减37.8%,节省资金悉数投向研发;净亏损率同比收窄超过31个百分点,综合毛利率 稳中有升 ;截至目前,2026年合同额已经同比增长65%,在手订单也已实现超过15亿元级别的体量,现金储备接近10亿元,盈利路径日渐清晰。 架构升级推动平台化转型,U2模型跻身全球第一梯队 报告期内,云知声持续完善"基座能力层-智能构建层-价值运行层"三层架构。智能体平台UniAgentOS已沉淀1773个实例智能体,单个模块最高复用119次,项目实施成本占比由去年同期的21%降至17%。收入模式从单一项目交付延伸至平台订阅、按量调用和持续运营,收入持续性进一步增强。 技术层面,云知声以U2为核心持续完善U-Model模型矩阵,推动通用基座、行业模型和多模态能力不断突破。在全球大模型竞技场上,U2已在多项高难度评测中跻身第一梯队,覆盖长上下文理解(AA-LCR)、知识推理(GPQA Diamond)、指令遵循(IFBench)、智能体执行(SWE-bench Verified)及复杂任务(WildClawBench)等核心维度,综合表现跻身LLM Stats总榜前25,位列全球模型厂商第八。 未来,云知声将继续 坚持"强基模、深应用"战略,进一步聚焦后训练 ,持续迭代U2及三医、语音、文档智能等模型; 并依托三层架构提高智能体模块的复用率,拓展更多行业与区域,以安全、合规、可控的方式推动智能向上、向善,为社会创造长期价值。 ### 当 OCR 学会"重建":云知声 U1-OCR 将图片、PDF 一键还原为可编辑 PPT,开启文档智能的重建时代 URL: https://www.unisound.com/research/141 发布时间: 2026-08-20 精心打磨的 PPT 方案只有 PDF 版本,重要汇报 PPT 仅存截图 —— 想改一句文案、换一张图片,却只能从头重做。这是无数职场人反复遭遇的办公困境。 这类问题的核心,并非简单的格式转换。传统工具只能浅层识别文档内容,而真正高效的转换,需要 AI 读懂页面逻辑、拆解版面结构,将被 "扁平化" 的静态文件,精准还原为可二次编辑的结构化 PPT。 以 U1-OCR 为代表的文档智能 OCR 3.0 时代,识别对象已从字符与文字行扩展到整页文档 —— 在读懂文字的基础上,进一步理解版式、结构与样式,以及页面的排版逻辑与内容架构。 近日, 云知声文档智能基础大模型 U1-OCR 能力全新升级,正式上线 IMG2PPT 智能转换功能 。IMG2PPT 基于 U1-OCR 文档智能引擎打造,可将 JPG、PNG、PDF 等静态文件中的内容还原为原生可编辑 PPT,让文本框、图片、列表、形状、表格等全部成为 PPT 原生可编辑对象。这标志着 OCR 技术正式从 "单一内容识别",进阶至 "智能理解 + 结构重建" 的全新阶段。 一、三重进阶:从 "识别" 到 "可编辑还原" 的能力跃迁 沿"识别 → 版面 → 理解 → 可编辑还原"这条技术主线,IMG2PPT 将对整页文档的"理解"能力拓展升级成"可编辑"能力。以"可用、可改、可复用"为核心,它跳出市面多数图片转 PPT 工具"仅视觉模拟、原生结构丢失"的局限——每一步能力提升,都凝结为用户可感知的亮点。 亮点一:文档级全局理解(识别 · 版面) 综合文字、图像与版面信息,以整页文档为对象,识别标题、正文、列表、图片、图标、形状、表格和背景,还原元素之间的组合、对齐与层级关系。传统 OCR 停留在"字符感知",提取的是零散的文字;文档智能 OCR 3.0 读懂多栏排版、图文混排、卡片组合、多级标题等复杂页面的排版逻辑与内容架构——读到的是一页完整的版面,而不是一列孤立的文字。 亮点二:版式还原与元素可编辑兼顾(理解) 转换结果不止于"文字是否正确",还同步还原元素位置、页面布局、字体、字号、颜色与对齐方式。可结构化的内容优先还原为独立元素,复杂视觉内容保留整体效果,兼顾版式一致性与后续编辑需求。 亮点三:原生元素与结构化组件重建(可编辑还原) 输出既不是整页图片,也不是简单文字提取,而是将文字、图片、列表以及可结构化的形状和表格还原为 PPT 原生元素,同时还原列表层级、项目符号、表格行列等结构信息——编辑时无需重新搭建。 最终,用户可直接修改文案、替换素材、调整版式、更改配色,无需从零制作,大幅提升历史方案迭代、客户版本定制、品牌视觉升级的办公效率。 二、场景实证:复杂高密度版面的无损复刻力 针对职场高频复杂 PPT 版面场景,IMG2PPT 展现出极强的结构化还原能力,可精准适配高密度、多组件的页面转换需求。 场景一:高密度多组件页面精准还原 输入原图 IMG2PPT 输出 以医保治理方案页面为例,该页面包含主副标题、多栏图标、说明文字、装饰图形,信息密度高、内容层级复杂。经 IMG2PPT 转换后,所有内容均拆分为独立可编辑对象,完整保留原有分栏布局与层级关系。用户可直接修改客户名称、模块文案、图标配色。 场景二:复杂图文混排页面完整复刻 输入原图 IMG2PPT 输出 以市场背景分析页面为例,该页面融合大标题、副标题、产品图片、深色内容区、编号图标及双栏说明文字,图片、文本与装饰形状之间的版式关系紧密。经 IMG2PPT 转换后,标题、图片、色块、图标和说明文本均拆分为独立可编辑对象,并尽量保持原有分区布局、对齐关系与配色风格。用户可直接替换图片、修改分析内容、调整编号模块和视觉样式。 三、五维领跑:结构化还原构筑代际优势 真实落地效果,以专业数据佐证。在五维评测中,围绕可编辑性、版式一致性、信息准确性、结构化组件还原、稳定兼容性五大核心维度,将 IMG2PPT 与主流竞品开展对比评测。数据显示,IMG2PPT 综合得分 4.30(满分 5 分),整体领先主流竞品 0.38 分。 其中,结构化组件还原得分 4.42、领先主流竞品 1.04 分,是差距最显著的维度,体现了从文字识别进一步延伸到列表、表格、形状等文档组件理解与重建的能力,印证了 IMG2PPT 的核心优势——不止识别文字内容,更能完整保留表格、列表、模块的原生结构关系,真正实现可直接复用的无损转换。 四、存量焕新:激活企业沉睡的静态内容资产 在日常办公中,"有内容、无原文件" 是普遍痛点:历年方案仅存 PDF、同事对接仅有 PPT 截图、老旧汇报素材无源头文件,这类内容仅可查看,无法二次编辑复用,大量优质办公资源被闲置。 在OCR 3.0 时代,云知声U1-OCR 发布的 IMG2PPT 智能转换功能为存量静态文档提供了高效盘活路径,可快速将 PDF、PPT 截图、图片版式文件还原为可编辑 PPTX 格式,支持文案替换、素材更新、版式调整、品牌升级,让老旧内容无需重做、快速迭代。 对企业而言,该功能可批量激活沉淀的 PDF、图片版方案素材,将闲置静态文档纳入企业模板库、素材库与知识资产体系,让固化的办公内容转化为可编辑、可复用、可流转的动态数字资产。 从 "识别" 到 "理解"再到 "可编辑",是 IMG2PPT 走出的完整路径 —— 上传一张图片或 PDF,即可得到一页可以直接继续编辑的 PPTX。这也标志着 云知声文档智能基础大模型 U1-OCR,完成了从 "识别文档" 到 "理解、重构文档" 的深度进阶 。未来,云知声将持续深耕文档智能领域,打磨 AI 办公技术,持续解锁文档处理新能力,让海量静态信息焕发全新价值,赋能高效智能化办公。 ### 云知声U2-RadiMed正式发布,引领医学影像AI迈入“临床推理”时代 URL: https://www.unisound.com/research/123 发布时间: 2026-08-13 智能向上,是不断叩击 AI 能力的上限;智能向善,是让每一次技术跃迁都抵达真实的临床需求。 2026 年 7 月,云知声发布 U2-Med 三医大模型,推动大模型能力深入医疗、医保、医药全域场景。时隔仅一个月,云知声医疗 AI 能力再次进化 —— 自研医学影像多模态大模型 U2-RadiMed 正式发布。 这一快速迭代既得益于深厚的技术储备,也恰逢医学影像 AI 的产业窗口期:云影像市场高速增长、医保影像互认政策加速落地, AI 辅助阅片的临床刚需愈发凸显。这一次,我们直面更复杂、更专业的医学影像挑战。 作为 国内首个深度融合医学影像理解、报告生成、临床推理决策、视觉问答的全链路影像大模型 ,该模型支持单张、多张影像与文本的多模态混合输入,可完成 “ 看影像 → 调知识 → 做推理 → 出结论 ” 的完整工作闭环,为临床医生提供从病灶筛查、精准诊断到个体化治疗决策的全方位 AI 辅助支撑,助力影像诊断迈向更高阶的智能化。 U2-RadiMed 全面覆盖 CXR 胸部 X 光、 CT 、 MRI 等主流医学影像类型,搭建起报告生成、病灶检测与定位、临床推理、临床决策、通用医学 VQA 、高级医学推理六大核心能力框架,是具备专业诊疗思维的 “ 影像科 AI 专家 ”。 一、深耕医疗 AI 迭代升级, U2 系列模型补齐影像认知核心能力 U2-RadiMed ,是云知声大模型能力在医疗领域一次次“向深处生长”的结果。 依托持续演进的技术体系,云知声不断推动通用智能向医疗专业场景纵深拓展:从通用基座大模型 U2 ,到覆盖医疗、医保、医药“三医”场景的专业大模型 U2-Med ,再到如今深入医学影像理解的 U2-RadiMed ,大模型能力正一步步走进更加复杂、更加专业的真实临床诊疗场景。 如果把这一演进过程比作培养一位“ AI 医生”: U2 让它学会思考, U2-Med 让它读懂医学,而 U2-RadiMed ,则让它真正拥有了一双“看懂医学影像的眼睛”。 在 U2-Med 专业医学能力底座之上, U2-RadiMed 进一步融合视觉理解能力,将影像中的病灶特征与医学知识、临床信息和诊疗逻辑连接起来。 因此,当它面对一张 CT 或一组 MRI 时,不再只是回答“图里有什么”,而是能够进一步围绕临床问题展开分析: 病灶在哪里?呈现出哪些特征?可能意味着什么?需要鉴别或排除哪些疾病?下一步又该如何判断? 从“看见影像”到“看懂影像”,再到结合医学知识进行推理与判断, U2-RadiMed 进一步打通了“医学视觉”与“医学认知”之间的链路,也让云知声医疗大模型向更专业、更深入的临床核心场景持续进化。 二、技术持续向上,多项核心能力领跑评测 顶尖的医学影像大模型,既要实现精准视觉识别,更要做到定位准、问答清、推理深。在多项横向评测中, U2-RadiMed 展现出全方位领先的硬核实力。 在通用综合测评中, U2-RadiMed 以 55.5 的综合得分位列第一 ,领先 Gemini 3.1 ( 47.9 分)、 GPT-5.4 ( 47.5 分),以及 Hulu-Med-27B 、 Qwen3.6-27B 等国内外模型,展现出更均衡的医学影像多模态综合能力。 在六大核心能力专项评测中, U2-RadiMed 实现四项能力登顶,包揽报告生成、病灶检测与定位、通用医学 VQA 、高级医学推理四大维度最高成绩。其中, 病灶检测与定位能力优势最为显著 ,以 37.6 分大幅领跑同类模型,精准攻克医学影像诊疗核心痛点,在病灶异常筛查、精准定位的关键环节建立绝对竞争优势。 同时,模型通用医学 VQA 达 74.2 分、高级医学推理达 46.8 分,两项核心指标均位列参评模型首位;临床决策、临床推理、报告生成,形成从病灶识别、影像解读、智能问答到临床推理、诊疗决策的完整闭环能力。 而在此前公布的 MedBench 5.0 全模态大模型评测 中, U2-RadiMed 以综合得分 57.2 的成绩位列参评模型第一,再次印证其顶尖的医学影像多模态综合实力。 三、突破单帧影像局限,看懂时序病程与临床诊疗逻辑 真实临床从来不是孤立地分析一张影像。 医生需要结合患者不同阶段的影像变化、临床信息与医学知识,对疾病进展、治疗效果以及后续方案进行综合判断。 U2-RadiMed 因此进一步突破传统 AI 单张影像分析的局限,可理解多时序影像之间的关联逻辑,支持病灶检测定位、影像智能问答、多时序影像对比、病程动态追踪、鉴别诊断、报告辅助生成等多元临床场景,更贴近医生真实的诊疗思维与工作流程。 案例一:时序影像串联 7 年病程,实现肿瘤诊疗全周期分析 针对低级别胶质瘤患者初诊、术前、术后三个阶段的 MRI 影像, U2-RadiMed 摒弃单图独立解读模式,可串联时序影像、还原完整病程。模型精准识别患者 7 年前 25mm 左侧额叶病灶、术前病灶增大至 45mm 的进展变化,同时研判术后肿瘤区域无明显占位,确认肿瘤完整切除。此外,模型可精准区分术区高信号水肿带为正常术后改变,并结合低级别胶质瘤病理特征,给出专业化术后随访建议。该能力让静态影像转化为动态病程故事,实现疾病进展、治疗效果、术后管理的全周期 AI 辅助。 案例二:全链路推理溯源,实现可解释性精准鉴别诊断 在 70 岁男性双眼突出的临床案例中,患者眼眶增强 CT 显示眶后脂肪突出、眼外肌增粗,存在肌腹增粗、肌腱附着处未受累的典型特征。针对该病例, U2-RadiMed 不局限于输出单一诊断结果,而是依托完整临床逻辑开展鉴别诊断。 模型首先结合核心影像特征,将甲状腺相关眼病( TAO )列为最优诊断,同时逐一排查特发性眼眶炎症、眼眶淋巴瘤、眼眶血管性病变等疑似病症,逐条列出各类病症的支持与排除依据。在此基础上,进一步给出标准化后续诊疗方案,包括甲状腺功能及抗体检测、眼眶 MRI 复查,以及必要时全身影像学评估、组织活检等检查方向。全程形成 “ 影像特征识别 → 医学知识调用 → 多维度鉴别诊断 → 风险概率研判 → 后续诊疗指导 ” 的完整推理链路,具备极强的临床可解释性与实用性。 四、智能向上更向善,让医学影像 AI 普惠临床 技术持续向上,价值始终向善。 U2-RadiMed 不仅追求医学影像 AI 能力的突破,更致力于让专业能力真正走进临床、服务医生。 此外, U2-RadiMed 即将上线云知声 MaaS 平台( Token Hub ) ,该平台提供 OpenAI 兼容接口,支持多图输入与 40K 上下文,可实现模型能力的开箱即用。体验链接: https://maas.unisound.com/ 从让 AI 拥有一双 " 看懂影像的眼睛 " ,到让专业影像能力走向更多医院、医生与临床场景, U2-RadiMed 正在以 " 向上 " 的技术力,践行 " 向善 " 的价值力,推动医学影像 AI 从技术突破走向真正的医疗生产力。 ### 云知声x哈啰出行:把AI装进Robotaxi,驶向智慧出行新可能 URL: https://www.unisound.com/news/128 发布时间: 2026-07-28 近日,云知声与国内顶尖普惠用车及本地生活服务平台哈啰出行达成战略合作。双方将围绕Robotaxi智能座舱、客服系统升级等核心场景,共同探索AI赋能出行服务的更多可能。 随着人工智能与自动驾驶技术的加速融合,智慧出行正在从传统“工具属性”向“智能体服务属性”演进。Robotaxi作为具身智能最具商业化潜力的落地场景之一,不仅改变车辆驾驶方式,也正在重塑乘客与出行服务之间的交互关系。未来的无人驾驶出行场景,将不再只是“把人送到目的地”,而是围绕乘客需求、车内环境、行程状态与服务体验,形成更加主动、自然、智能的出行服务体系。 哈啰出行长期深耕普惠用车及本地生活服务领域,拥有庞大的出行场景数据、成熟的运营体系和丰富的用户服务经验。在积极布局Robotaxi赛道的过程中,哈啰出行希望通过AI技术持续提升无人驾驶场景下的服务质量与用户体验,打造更安全、更便捷、更有温度的智慧出行服务。 云知声作为世界一流的 AGI 科技企业,具备算法、算力、芯片及大数据处理的技术闭环能力。依托自主研发的U2大模型及自研AI芯片,云知声在人机协同、大模型服务、边缘计算和多模态智能交互等领域持续深耕,能够为Robotaxi座舱、智能客服及场站服务等复杂场景提供端到端AI能力支持。 根据合作规划,双方将共同推动云知声U2大模型与哈啰出行Robotaxi座舱系统的深度整合,赋予Robotaxi自然语言对话、乘客意图识别、情感交互及主动服务能力。双方还将联合研发多类主动响应功能,包括大件行李识别辅助、紧急情况声视觉预警等,进一步提升Robotaxi的智能化、安全性与服务可用性。通过大模型、多模态感知与边缘智能能力的结合,Robotaxi有望从“无人驾驶车辆”升级为具备主动服务能力的“移动智能体”。 除智能座舱外,双方还将依托云知声大语言模型技术,对哈啰出行客服系统进行智能化升级。升级后的客服系统将支持多语种、多方言的高精度语义解析,并通过AI机器人实现7x24小时自动化问题分类、处理与响应,在提升服务效率的同时,进一步改善用户满意度与服务体验。 同时,双方将积极探索出行场站内的移动服务机器人应用,包括自动寻车导引、自动补能、场站安防巡检等场景,推动智慧出行从车辆端、座舱端、客服端延伸至场站端,逐步形成端到端无人化服务闭环。 此次合作,是双方在智慧出行与人工智能融合方向上的重要探索。未来,云知声将以U2大模型为核心,持续发挥全栈AI优势,与哈啰出行共同推进Robotaxi场景下的服务创新,为用户带来更加自然、安全、高效和智能的出行体验,也为自动驾驶商业化落地提供更具想象力的实践样本。 ### 云知声U2-ASR、U2-TTS多语种能力全面升级,一套模型打通全球"听与说" URL: https://www.unisound.com/research/125 发布时间: 2026-07-28 在刚刚过去的2026世界人工智能大会开幕式上,国家主席习近平在《携手构建公正合理的全球人工智能治理体系》主旨讲话中深刻指出:“各国应当秉持以人为本、向上向善理念,让人工智能成为促进共同繁荣、维护共同安全的一个重要动力源,携手构建公正合理的全球人工智能治理体系。” 这一愿景,为AI的发展指明了方向。技术的“向上”探索,是突破极限、追求极致的硬实力;而技术的“向善”应用,则是普惠大众、消除鸿沟的暖温度。二者一体两面,共同构成了AI时代的核心价值。 云知声积极响应这一时代呼唤, 近日全面完成U2-ASR与U2-TTS的多语种能力升级:ASR新增13种国际语言识别,TTS新增8种东南亚语言合成。至此,U2语音大模型已支持超100种中国方言及超15种国际语言。 此次升级,不仅是云知声技术能力的又一次飞跃,更是对“智能向上”与“智能向善”理念的坚定实践。 智能向上:以技术突破,攀登语音能力新高峰  技术的“向上”,意味着持续挑战能力边界,并将前沿技术转化为稳定、高效、可规模化调用的基础设施。 过去,企业要构建一套覆盖多个国家和地区的多语种语音系统,往往需要分别采购、部署和维护多套模型,不仅成本高、周期长,也面临接口不统一、系统协同复杂、后期运维压力大等问题。 此次U2-ASR与U2-TTS多语种能力升级,正是为了打破这一技术壁垒,通过统一模型、统一接口与标准化服务,帮助企业更高效地构建全球化语音交互能力。 U2-ASR:统一模型,听懂世界 本次升级中,U2-ASR进一步拓展统一多语种联合建模架构,新增支持: 阿拉伯语、德语、西班牙语、法语、印尼语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、意大利语 等13种国际语言。 针对不同语言在音素体系、发音节奏、语调规律及口音分布等方面的差异,U2-ASR通过统一联合建模,实现跨语言特征的协同学习与能力共享。 现在,企业只需接入一个模型、一套接口,即可处理不同语言的音频内容,无须分别部署和维护多套识别系统。 在统一测试口径下,U2-ASR与Whisper Large V3 Turbo、FunASR、Seed-ASR等业界代表性模型进行了对比评测,并分别验证了“显式传入语种标签”与“不传入语种标签”两类场景下的识别表现。 显式传入语种标签时 :U2-ASR在13种语言工业级测试集上的平均字错率(CER)低至6.58%,12种语言CER低于8%,德语、西班牙语、印尼语、意大利语、越南语等5个重点语种更全部进入5%以内。 在图示的对比评测中,U2-ASR均取得最低CER, 实现全线领先 。其中,越南语CER低至3.01%,俄语和印尼语分别低至5.26%和3.41%,展现出覆盖不同语系的稳定识别优势。与FunASR 1.5、Seed-ASR、Whisper large-v3-turbo、Cohere transcribe、Qwen3-ASR-1.7B等模型相比,U2-ASR相较各语种表现最优的其他模型平均相对降错约30%;其中,越南语相对降错超过50%,俄语和印尼语分别降低约41%和37%,整体性能优势显著。 不传入语种标签时(更贴近真实业务) :面对无标注的音频流,U2-ASR 凭借自动语种识别与闭集路由能力,依然保持高准确率,有效避免了语种误判和错误率飙升。在跨境客服、国际会议、多语种内容审核等场景下,企业无需前置语言分类,即可获得稳定、可靠的识别结果。 U2-TTS:自然发声,言说全球 如果说ASR解决的是“听懂用户”,那么TTS决定的,则是AI能否用用户熟悉的语言自然回应。 此次升级中,U2-TTS重点强化东南亚多语种语音合成能力,新增支持: 泰语、越南语、印尼语、马来语、缅甸语、柬埔寨语、菲律宾语、老挝语 等8种语言。 针对不同语言的发音规则、语调习惯、停顿节奏和韵律特征,U2-TTS进行了专项优化,让AI不仅能够“开口说”,还能够说得更加清晰、自然、流畅,更符合当地用户的语言习惯。 自然流畅,提升本地化交互体验: U2-TTS能够准确还原不同语言的发音特点、语调变化和表达节奏,为当地用户带来更加自然、亲切的语音交互体验。对于拓展海外业务的企业而言,本地化不再只是界面与文字内容的翻译,还可以进一步延伸至语音交互,让产品真正以当地用户熟悉的方式进行沟通。 流式架构,实现首包快速响应: U2-TTS采用流式神经网络声学模型,可逐chunk实时输出24kHz、16bit高保真语音。通过“边生成、边播放”的流式机制,模型能够有效降低首包等待时间,避免长文本全部生成后才能播放的问题,更好地满足实时语音对话、数字人驱动、智能客服、车载交互及智能终端等强时效场景的应用需求。 智能向善:以普惠初心,跨越语言数字鸿沟 技术的“向善”,不仅体现在能力有多强,更体现在技术能够服务多少人、覆盖多少场景,以及能否让更多国家、地区和语言群体共享人工智能发展成果。 长期以来,全球AI语音技术资源更多集中于中文、英文等大语种,部分发展中国家及语言资源相对有限的市场,仍面临训练数据不足、模型建设成本高、优质服务供给有限等问题。 云知声此次推进多语种能力升级,正是希望通过统一模型和标准化服务,让优质语音技术覆盖更多语言与用户,推动跨语言智能交互从“高门槛建设”走向“低门槛调用”。 开箱即用,让全球化语音能力触手可及 云知声将复杂的多语种AI能力,转化为标准化、开箱即用的MaaS(模型即服务)。 无论是 跨境出海企业、智能硬件厂商 ,还是 数字人、在线教育、智能客服及内容平台 ,均可通过标准API快速接入多语种ASR与TTS能力,显著缩短研发周期。企业无需再从零开始采集语料、训练模型或搭建底层系统,即可以极低的成本构建面向全球用户的智能语音应用,让技术真正转化为商业协作与产业发展的生产力。 让小语种被听见,让多元文化被看 语言不仅是信息传递的工具,也是文化与身份的重要载体。 当老挝语、柬埔寨语、缅甸语等语言也能够获得高质量的AI语音支持,技术所创造的价值,便不再局限于提升交互效率,也有助于推动不同语言与文化在数字世界中被听见、被理解、被保留。 从面向不同地区的智能教育,到跨境医疗沟通、公共服务与文化内容传播,多语种语音技术正在不断拓展AI普惠应用的边界,让智能服务触达更多地区和人群。 从“听见”到“回应”,打通全球语音交互闭环 从“百种方言”的本土深耕,到“全球多语种”的能力拓展,云知声正加快构建覆盖语音识别、理解与合成的完整能力矩阵。此次U2-ASR与U2-TTS的协同进化,彻底打通了多语种语音交互的“入口”与“出口”,形成了从“听见”、“听懂”到“回应”的完整闭环,为Agent时代的全球化交互奠定了坚实的语音基础。 技术的演进,最终应回归人的需求与福祉。让更多语言被AI准确理解,让全球用户都能听到自然、亲切的AI声音,正是云知声践行“智能向上”与“智能向善”的具体体现。通过不断深化普惠实践,云知声致力于消除语言壁垒,让前沿AI技术真正服务于全球用户的真实需求。 面向未来,云知声将不断突破技术极限,让智能语音成为跨越文化鸿沟、连接全球数字生态的核心纽带。作为中国AI企业的代表,云知声将持续以多语种交互能力共筑全球智能桥梁,促进跨语言交流与全球文化沟通,为推动世界数字经济的共同繁荣贡献中国智慧与力量。 目前,完成多语种能力全面升级的 U2-ASR 与 U2-TTS 已全量上线 云知声TokenHub大模型服务平台 ,并开放标准API,支持开发者与企业根据业务需求灵活调用。 欢迎广大开发者、企业及个人用户登录平台,抢先体验: U2-ASR https://maas.unisound.com/models/asr U2-TTS https://maas.unisound.com/models/tts ### 全国率先!厦门人工智能公共服务平台上线,云知声助力打造“AI+企业服务”新标杆 URL: https://www.unisound.com/news/129 发布时间: 2026-07-24 7月23日,厦门市工业和信息化局召开新闻发布会,宣布厦门市人工智能公共服务平台正式启动试运行;同时,运行超过二十年的厦门市中小企业公共服务平台“慧企云”完成全面智能化升级。 作为此次平台建设的核心技术支撑方,云知声深度参与了这场“企业服务智能化”的厦门式探索,推动企业服务从“企业自己找”迈向“服务主动送”,为全市数字经济高质量发展注入新动能。 以AI核心能力 , 支撑市级人工智能公共服务平台建设 当前,人工智能正加速从“锦上添花”走向“刚性需求”。为贯彻落实市委市政府工作部署,加快培育战略性新兴产业,厦门市依托“慧企云”二十年的企业服务积淀,先行先试建设人工智能公共服务平台,打通AI技术供给与产业需求之间的“最后一公里”,推动“人工智能+”深度赋能工业、政务、医疗等各领域,促进传统产业转型升级与新兴产业培育壮大。 在平台建设中,云知声围绕智能体集群、AI资源匹配、企业服务智能化等方向提供核心技术支撑,助力平台构建市级AI赋能底座,让企业能够更便捷地获取AI能力、服务资源和产业机会。 区别于传统的“算力超市”或“模型集市”,本次上线的平台核心亮点在于首创AI智能体集群。平台首批推出包括动态资讯、全能力超市、智改数转、商业计划书、融资服务、供需匹配、政策服务等在内的8个垂直场景智能体,并由“AI慧企管家”进行统一调度。企业用户只需通过一次自然语言对话,即可获得从“分析、匹配、撮合、落地”的全链路闭环服务,实现企业服务从“人工响应”向“7×24小时智能服务”的全面跃升。 “慧企云”三大跨越,升级全链条精准服务 作为厦门市人工智能公共服务平台的底座,“慧企云”在此次升级中完成系统性提质升级,实现三大跨越: 一是服务方式跨越,从“企业自己找”转变为“服务主动送”。平台依托企业动态画像与AI智能中枢,将适配的政策、融资产品及技术资源精准推送上门。 二是服务深度跨越,从“综合大而全”迈向“专业精而深”。平台新增人工智能产业服务、智改数转服务、科技创新服务及企业出海服务四大专业化专区,形成覆盖企业全生命周期的精准服务链条。 三是服务效率跨越,从“人工查找式”进入“对话定制式”新阶段。通过智能体即时响应,大幅提升企业问题智能化解决率。 目前,“慧企云”已累计服务企业超750万家次,活跃企业用户超24万家。平台现已整合AI资源超2100项、智改数转服务产品及科技成果超1600项,企业可一站式获取全链路AI资源、创新资源。 从企业服务平台到人工智能公共服务平台,从“企业找服务”到“服务找企业”,这次升级不只是一次平台功能的迭代,更是厦门城市级AI能力服务产业、服务企业、服务千行百业的一次重要探索。 对云知声而言,此次深度参与厦门市人工智能公共服务平台建设,是其以城市级AI基础设施为支点、推动产业智能化转型的关键落子。从智能体集群协同到企业服务全链路闭环,云知声正将大模型能力转化为赋能实体经济的切实生产力。未来,云知声将持续深耕城市公共服务、企业智改数转与产业资源精准匹配,全力支撑厦门打造数字经济新高地,并为全国中小企业公共服务体系的智能化升级提供可复制的实践范本。 ### 让智能不断向上,让技术始终向善|云知声携U-Model家族亮相 WAIC 2026 URL: https://www.unisound.com/news/130 发布时间: 2026-07-18 7月17日至20日,以“智能伙伴,共创未来”为主题的 2026 世界人工智能大会暨人工智能全球治理高级别会议(WAIC 2026)在上海举行。国家主席习近平出席大会开幕式并发表主旨讲话,为人工智能产业发展与治理凝聚共识、指明方向。 从70年前“人工智能”概念首次提出,到今天智能技术加速走出数字世界、进入物理世界,人类与人工智能之间的关系正在被重新定义。面对这一轮前所未有的技术浪潮,习近平主席强调,各国应当秉持以人为本、向上向善理念,让人工智能成为促进共同繁荣、维护共同安全的重要动力源。 这也赋予了WAIC大会主题“智能伙伴,共创未来”更加深刻的时代内涵——真正的智能伙伴,不仅要拥有理解复杂问题、执行复杂任务的能力,也要可靠、可控、值得信赖;不仅要不断突破技术边界,更要始终服务于人的价值。 对于云知声而言,如何让AI真正成为人的智能伙伴,最终落在两条彼此交织的实践路径上:一条是“智能向上”,一条是“智能向善”。在上海世博展览馆H1-D730展位,云知声携以U2为核心的U-Model矩阵与三大Agent集群集中亮相,从模型能力的持续突破,到智能体走进医疗健康、组织流程与日常生活,全方位展示云知声的智能伙伴如何从理解世界、感知需求,进一步走进工作流、与人协同完成任务,以自身实践呼应时代命题:让智能不断向上,也让每一次技术进步,始终向善而行。 智能向上丨以U2为核心,持续攀登能力上限 真正的智能伙伴,要有足够强的理解、感知与执行能力。展会现场,云知声集中展示了以U2为核心的U-Model矩阵。从通用基座大模型,到语音与视觉感知,再到医疗垂直领域的专业模型,云知声持续攀登智能能力与效率的双重上限:一方面,让模型能够理解更复杂的信息、完成更长链路的任务;另一方面,在有限的计算与 Token 成本下提升每一次调用的价值,让更强的智能以更高效、更可负担的方式进入真实场景。 U2:不止“给出答案”,更在于“完成任务” 作为云知声面向个人、开发者与组织打造的原生智能体大模型,U2以高智能密度、高Token价值、原生Agent能力三大核心突破,重新定义了大模型的效率与自主能力。 在复杂办公、软件工程、深度研究与多工具协同场景中,U2能够自主拆解并推进100+步复杂工作流,将需求理解、任务规划、环境交互、工具调用、过程纠错与结果验收串联为完整闭环——从“给出答案”进一步走向“完成任务”。 在全球大模型竞技场上,U2已在多项高难度评测中跻身第一梯队,覆盖长上下文理解(AA-LCR)、知识推理(GPQA Diamond)、指令遵循(IFBench)、智能体执行(SWE-bench Verified)及复杂任务(WildClawBench)等核心维度,其综合表现更是跻身LLM Stats总榜前30,位列全球模型厂商第八,已然开启与头部模型的同台较量。尤为值得一提的是,在公认极具挑战性的长文本理解基准LongBench-V2中,U2以54.4%的Accuracy超越Claude Opus 4.7,充分展现出其对海量信息的持续捕捉与深层推理能力。 多模态大模型矩阵:让AI拥有完整感官能力 复杂任务不仅需要“会思考”,也需要准确感知与表达。围绕听、说、看,U-Model构建起覆盖真实交互入口的多模态感知底座。 U2-ASR(听觉): 不止是语音转文字,更能“听懂”表达。U2-ASR支持上百种方言及多种外语,在复杂嘈杂环境下依然保持90%的识别准确率。在AISHELL-1公开测试集中达99.2%,其方言识别能力全面超越主流ASR模型。 U2-TTS与Clone(表达): 让AI声音更有温度。基于纯因果注意力机制的流匹配模块与神经声码器联合优化,U2-TTS不仅能生成自然流畅的语音,还能精准演绎语气、情绪乃至呼吸与笑声等拟人化细节。配合U2-TTS-Clone的声音克隆能力,仅需5-15秒参考音频即可高保真还原音色,合成自然度与相似度达MOS 4.5+。更支持“音色来自A,情感来自B”的组合式生成及中英文跨语种复刻,能够以极低的成本为数字人、有声内容等注入鲜活个性。 U1-OCR(视觉): 从“识字”进化到“懂文档”。U1-OCR突破传统OCR仅字符识别的局限,实现从“认字”到“懂文档、会提取”的升级。能够精准还原复杂版式(如嵌套表格),智能抽取关键信息,将非结构化文档高效转化为可计算的数据。 医疗双子星:让AI真正读懂“三医” 在专业壁垒极高的医疗领域,U-Model 家族派出了“文本+视觉”的双子星,将大模型直接转化为医疗生产力: U2-Med: 深度掌握医疗、医保、医药“三医”知识,贯通临床诊疗、基金监管、药事服务全场景。不仅能辅助医生生成规范病历、进行临床决策支持,还能在医保审核、商保理赔等场景中充当“风控专家”——在业务场景实测中,其病历质控达97%、安全伦理达95.5%、诊后与用药管理达94.1%、医保/商保能力达88.8%,综合能力达89.1%,全面超越同级别主流大模型。 U1-OCR-Med: 专为医疗文书打造。面对手写潦草的病历、印章遮挡的处方或复杂的检查报告,U1-OCR-Med能实现像素级定位与精准抽取,可有效解决医疗数据录入中最头疼的“脏数据”难题,更让U2-Med的分析有据可依。 智能向善丨让Agent进入工作流,服务每一个真实需求 对云知声而言,“智能向善”不是为技术附加一层温情叙事,而是让AI始终以人为中心。真正的智能伙伴,不是取代人,而是在专业场景中辅助人、在复杂流程中协同人;既要做到可靠、可控、可追溯,也要让先进能力以可负担的方式服务更多组织与个体。 此次WAIC,云知声围绕医疗健康、组织流程与智能交互,集中呈现医疗专家、数字员工与数字助理三大Agent集群。它们不再停留在单轮问答与功能演示中,而是进入工作流,与人协同完成复杂任务,把模型能力转化为可执行、可验证、可交付的成果。 医疗专家Agent丨贯通三医,守护每一份健康 在专业壁垒极高、容错率极低的医疗场景中,医生长期被病历录入与合规审查所困——大量时间耗费在键盘敲击与事后补写上,传统的人工抽检质控滞后且覆盖面有限,诊疗时间被挤占,合规风险却在累积。 医疗专家Agent深度融入诊前、诊中、诊后全流程,可实时采集医患对话、自动生成规范病历,将医生从键盘前解放出来;对病历完整性、逻辑性与合规性进行实时校验,推动质控从“事后追责”向“事中预警”转变;贯通医保智能审核与药品耗材价格合规审查,让“三医”风险管控融入每一个业务环节——让医生回归诊疗本身,将合规交给AI。 数字员工Agent|流程自动奔跑,员工回归创造 在企业组织中,大量业务执行人员常年充当“系统搬运工”——工单处置、公文流转、费用报销、合同风控等高频任务散落在多个互不相通的系统中,跨平台切换、手动复制粘贴占据了大量时间,人为差错与合规盲点也难以避免。 云知声数字员工Agent覆盖政务工单处置、多语种客服、公文收办与档案分拣、费用报销与合同风控、医保价格稽核、表单标准化与智慧营销等场景,可将跨岗位、跨系统的机械操作编排为自动执行的标准化工作流。技术的价值不只是让流程跑得更快,更是让员工从重复劳动中抽身,把时间留给判断、沟通与创造。 数字助理Agent:懂办公,更懂生活 在政企与企业的日常办公中,最耗时的往往不是“写字”,而是“找字”与“理字”——起草公文、审核合同、编写纪要,每一项任务背后都是大量资料查阅、政策理解与逻辑梳理的拉锯战。而在车载等生活场景中,交互的繁琐同样让人疲惫——触控操作分散驾驶注意力,语音指令频频中断,智能座舱既不“智能”也不“体贴”。 云知声数字助理Agent覆盖公文撰写与审核、会议纪要、合同起草、招标造价预测、行政知识问答等高频办公场景,能够自动完成“查找资料—理解背景—匹配规范—梳理逻辑—生成成果”的完整闭环,让办公不再是信息的苦役。进入座舱场景,车载Agent能通过自然、连续的多模态交互,帮助驾驶者完成导航、影音娱乐、车辆控制与资讯查询等高频操作。技术不再要求人反复适应系统,而是让系统以更自然的方式服务于人。 从模型能力的持续突破,到三大Agent集群进入真实工作流,WAIC 2026所呈现的,不仅是云知声让AI从“理解问题”走向“完成任务”的阶段性成果,更是其对“智能向上、智能向善”的持续践行,也是对大会主题“智能伙伴,共创未来”的具体回应——以技术突破不断抬升智能伙伴的能力上限,以场景落地让AI真正走到人身边、进入工作流,与产业、组织和个体共同创造价值。 智能的进化仍在继续。接下来,云知声将在语音技术领域迎来两项重磅升级——新一代 U2-ASR 与 U2-TTS 即将发布: 一个负责“听懂”更多语言。 新一代 U2-ASR 将重点升级外语识别与转写能力,进一步拓展可识别的语言范围,让更多外语能够被准确理解并转化为文字。 一个负责“说出”更多语言。 新一代 U2-TTS 将升级多语种语音合成能力,支持更多外语自然表达,让 AI 能够以不同语言生成流畅、真实的语音,进一步降低跨语言沟通与内容生产的门槛。 从听懂每一种表达,到自然说出每一种语言,U2-ASR 与 U2-TTS 将共同拓展 AI 感知世界、连接人的能力边界,为智能体进入更多真实场景构建更加自然、高效的交互入口。敬请期待。 ### 云知声发布U2-Med专家级三医大模型:以【智能向善】重塑产业,让AI成为扎根一线的“数字专家” URL: https://www.unisound.com/research/126 发布时间: 2026-07-17 刚刚,云知声正式发布首个深度融合医疗、医保、医药(含商保)全链路的专家大模型——U2-Med三医大模型 。这标志着云知声自研的U2通用基座大模型,在医疗垂直领域完成了从“通用智力”到“专业生产力”的关键跨越。就像Anthropic的基座模型在代码生成领域展现出惊人的爆发力一样,U2-Med将U2基座强大的认知与推理能力,完美适配到了复杂的“三医”场景中。 以“智能向善”为初心,U2-Med致力于将AI从“对话工具”升级为扎根业务一线的“数字专家”。通过打破三医数据与业务的孤岛,重构产业生态,U2-Med不仅是在攀登技术的高峰,更是在仰望人类健康的星辰大海——以AI的力量推动医疗服务向更高效、更公平、更智能的方向演进,让科技的温度真正造福全人类的健康福祉。 01 范式跃迁:从“通用对话”到“三医联动”的执行专家 过去两年,通用大模型虽博闻强识,但在面对医疗行业严苛的准确性与复杂的业务逻辑时,往往陷入“只会聊天、无法干活”的窘境。U2-Med的发布,旨在解决这一核心痛点。 依托云知声自研的U2通用基座大模型及十年医疗行业深耕经验,U2-Med实现了从“认知”到“执行”的跨越式升级。它不再是一个泛泛而谈的问答机器人,而是通过内置超过70个可调用、可编排的专业Skill(技能)体系,具备了深度理解病历、报告、账单与政策的能力。 模型能够为所有输出结果提供清晰、可追溯的证据链,真正从“屏幕里的对话框”走向“业务流的神经中枢”,成为三医联动协同的智能底座。 02 三医协同:打破孤岛,构建全域业务闭环 U2-Med的核心价值在于其“联动”能力。它并非三个独立领域的简单叠加,而是通过统一的智能底座,将原本割裂的诊疗、支付与供给环节串联起来,形成高效闭环。 医疗端:化身不知疲倦的“超级临床大脑” U2-Med深度嵌入院内全流程,宛如医生的“超级外脑”。它不仅能自动生成标准化智能病历,将医生从繁重的文书工作中彻底解放;更能敏锐捕捉临床文书风险,像一位严谨的质控专家,提前拦截漏诊与差错隐患。它大幅压缩了案头工作时间,让医生将宝贵的精力100%回归到诊疗核心,专注救治每一位患者。 案例:复杂体检异常的“深度归因与全景健康管理 面对一份包含肝酶升高、糖调节异常、混合性血脂异常等数十项错综复杂指标的体检报告,U2-Med并未停留在简单的“指标异常提示”层面。模型深度穿透数据表象,将异常精准归纳为代谢综合征相关的三大核心问题簇,并结合患者超重特征,敏锐提示代谢相关脂肪性肝病(MASLD)的潜在风险。针对单次eGFR偏低,模型严谨指出不可直接确诊慢性肾病,并自动生成包含复查尿白蛋白/肌酐比值、糖耐量试验及心血管总体风险评估在内的结构化随访计划。U2-Med将碎片化的检验数值转化为高维度的健康洞察,真正实现了从“数据罗列”到“临床辅助决策”的认知跃迁。 医保&商保端:铸造坚不可摧的“智能守门人” 全面适配DRG/DIP支付改革,U2-Med化身全天候在线的“基金守门人”。它拥有敏锐的“数据洞察力”,能瞬间穿透海量单据,精准甄别超限用药、重复收费、过度诊疗等合规疑点。通过全单据智能初审,它高效过滤绝大多数常规风险,让人工团队得以聚焦于高风险核查,真正实现控费与提质的双向奔赴。 案例:超说明书用药的“交叉验证与精准拦截” 在“格列吡嗪片”审核案例中,模型不仅确认了药品使用事实,更通过交叉验证发现患者存在“急性心梗、肾功能不全”等高风险背景,精准判定其不符合医保支付限定条件,并给出完整证据链,帮助审核人员聚焦高风险核查。 医药端:担任全链路的“专业护航员” 覆盖药物全生命周期,U2-Med是药企研发与合规管理的“最强辅助”。从临床试验中秒级预筛受试者,到自动核验药品适应证与禁忌证;从实时预警合并用药的配伍风险,到将晦涩的药品说明书智能结构化。它贯穿研发、监护与合规全流程,为每一粒药的安全上市与合理使用保驾护航。 案例:复杂入排标准的“逻辑树拆解与精准匹配” 在一项针对“腹腔镜或机器人腹股沟疝修补术”的临床试验中,面对包含单侧、有症状等严苛入组条件,以及未成年、急诊、复发疝等多项排除标准,U2-Med对49岁男性患者的电子病历进行了深度解析。模型将复杂的入排标准自动拆解为可执行的核验逻辑树,逐一比对患者诊断、手术计划与既往史,精准排除肠管嵌顿等潜在风险,最终高效判定该患者符合入组。这一过程将原本需要数小时的人工核对缩短至秒级,大幅提升了临床招募效率与合规性。 03 智能向善:科技赋能,守护全人类健康福祉 U2-Med构建的“三医联动”体系,其终极意义超越了单一环节的效率提升,而是指向对全人类健康福祉的深切关怀,这正是“智能向善”的最高体现: 促进医疗公平 : 将顶尖诊疗经验与质控标准下沉至基层,打破地域资源壁垒,让优质医疗服务更公平可及。 筑牢生命防线 : 精准守护医保“救命钱”,加速创新药研发进程,从支付保障到药品供给,全方位护航生命健康。 重塑医患温度 : 将医生从繁重的机械劳动中解放出来,让技术承担“计算”,让人类回归“关怀”,重建有温度的医患关系。 04 权威评测:双榜登顶,实力领跑 大模型的价值,最终体现在解决专业领域复杂问题的实际能力上。在2026年7月发布的MedBench5.0评测中,U2-Med凭借卓越逻辑推理能力,在“智能体评测榜单”核心文本榜单中强势登顶。同时,基于U2-Med文本底座结合视觉编码器联合训练而成的U2-RadiMed(医疗影像大模型),在“全模态大模型评测榜单”中斩获第一。 在面向真实业务构建的“三医综合Benchmark评测”中,U2-Med在病历生成与质控(93.3分)、诊后与用药管理(94.1分)、安全伦理(95.5分)等核心任务上的表现同样卓越。 这些数据充分证明,U2-Med已具备将底层通用智力完美转化为垂直行业生产力的坚实基础,其技术能力可直接转化为产业落地价值。 05 从“工具替代”到“生态重构”的无限想象 U2-Med的价值远不止于提升单一环节的效率,它正在开启一个由AI驱动的全新医疗健康生态: 跃迁为“数字基础设施” :当U2-Med深度嵌入医疗、医保、医药的核心业务流后,它将如同电网之于工业社会,成为支撑智能医疗时代运转的底层基座。 转动“正向飞轮” :模型在真实业务中沉淀的高质量数据,将持续反哺其变得更精准、更智能,进而吸引更多机构接入,构筑起难以逾越的生态壁垒。 开启“AI原生医疗”新范式 :未来不再是“AI辅助医疗”,而是从新药发现、个性化诊疗到医保全局优化的全产业链重构。U2-Med正是这一新范式的先行者,探索着AI从根本上提升人类健康福祉的宏大命题。 目前,U2-Med已正式上线云知声Token Hub,面向个人、开发者及组织开放。点击体验: https://maas.unisound.com/models 。 我们相信,当AI真正扎根于医疗业务的一线泥土,践行“智能向善”的初心,它便不再仅仅是提升效率的工具,而是成为了守护全人类健康福祉的基石。云知声正以星辰大海的征途,推动整个医疗健康产业向着更高效、更公平、更智能的AGI时代加速迈进, 让 科技的温度与力量,真正普惠每一位患者,照亮人类健康的未来。 ### FocalOrder:面向阅读顺序检测的焦点偏好优化方法 URL: https://www.unisound.com/research/143 发布时间: 2026-07-07 ### VAPO:利用全模态大语言模型实现端到端幻灯片增强语音识别 URL: https://www.unisound.com/research/146 发布时间: 2026-07-07 ### HEALing 熵坍缩:基于混合领域熵动态对齐的少样本 RLVR 探索增强方法 URL: https://www.unisound.com/research/145 发布时间: 2026-07-07 ### GuideTree:面向长篇医疗记录的指南引导式审阅树 URL: https://www.unisound.com/research/144 发布时间: 2026-07-07 ### 超越模态坍缩:通过引导模态熵调控实现全模态情感推理 URL: https://www.unisound.com/research/142 发布时间: 2026-07-02 ### 云知声发布 U2:为执行而生的原生智能体大模型,可自主拆解并完成 100+ 步复杂真实工作流 URL: https://www.unisound.com/research/127 发布时间: 2026-06-08 刚刚,云知声正式发布新一代通用大语言模型——U2。 作为我们面向个人、开发者与组织打造的原生智能体大模型,U2的技术主张极为纯粹:高智能密度 × 高Token价值。它不再盲目堆叠参数,而是追求高智能密度,用更少激活资源承载更强能力;不再简单比拼输出长度,而是追求高Token 价值,让每一次调用都更接近交付结果。 与传统大模型更偏向单轮问答或短链路生成不同,U2 更强调面向真实任务的连续执行能力。在复杂办公、软件工程、深度研究与多工具协同场景中,U2 能够自主拆解并推进 100+ 步复杂工作流,将需求理解、任务规划、环境交互、工具调用、过程纠错与结果验收串联为完整闭环,从“给出答案”进一步走向“完成任务”。 权威评测进入第一梯队,U2展现硬核实力 在最新发布的一系列国内外权威能力评测中, U2已经在多个关键能力方向进入主流大模型第一梯队: 在衡量知识与复杂推理能力的 GPQA Diamond 上,U2 取得 87.9 分,超过 GLM-5.1、Hy3 preview、DeepSeek-V4-Flash(High)和 MiniMax M2.7,展现出对高难度知识问题的稳定理解、推理与求解能力。 在衡量真实软件工程能力的 SWE-Bench Verified 上,U2 取得 75 分,进入主流模型第一梯队。 而在面向自主 Agent 端到端执行能力的 Claw-Eval(pass@3) 上,U2 取得 76.9 分,超过 Hy3 preview、DeepSeek-V4-Flash(High)和 MiniMax M2.7,进一步验证了其在工具调用、流程编排与任务交付中的稳定表现。 在面向真实办公与知识工作交付能力的 GDPval 上,U2 取得 72.9 分,展现出扎实的专业办公能力。相比传统问答式评测,GDPval 更关注模型能否完成真实工作场景中的高价值交付,包括资料分析、报告撰写、表格处理、图表生成、幻灯片制作等典型办公任务。 这组成绩背后,传递出一个重要信号:U2并不是以单点能力取胜,而是在推理、代码、Agent和办公交付等多项关键能力上形成了系统性表现。 混合思考 + Harness 联合训练:让模型原生能力进入真实工作流 对云知声而言,U2 不只是一个模型代号,更是我们对 AI 2.0 时代大模型价值的重新思考。我们认为,衡量今天的大模型价值,不能再单纯比拼参数规模和内容生成长度。当 AI 真正进入真实工作流,用户关心的不再只是模型能否给出一个漂亮回答,而是它能否真正把任务完成。 因此,U2 从设计之初,就不是一个单纯面向聊天场景的通用模型,而是一款面向任务执行的原生智能体大模型。 要让模型真正完成任务,仅靠更大的参数并不够。真实工作流往往复杂、动态且长链路:模型既要能够快速理解目标、拆解任务、搜索路径,也要能在关键节点进行逻辑校准、约束检查和结果验证。传统显式思维链虽然具备较强可解释性,但往往需要生成大量中间推理文本,带来更高 Token 消耗与推理延迟;而完全依赖隐空间推理,虽然效率更高,却可能在复杂任务中出现逻辑漂移,缺乏足够的可控性与验证能力。 为了解决这一矛盾,U2 创新引入混合思考机制。它并不是在显式 CoT 与隐式推理之间二选一,而是在同一推理过程中,根据任务阶段、复杂度和不确定性动态切换思考形态。 在任务早期,U2 优先在隐空间中进行高效探索,完成路径搜索、任务拆解、候选方案生成与执行规划,避免把每一步中间思考都解码为可见 Token;当任务进入关键判断、复杂约束处理或结果收敛阶段,模型则切换到显式推理,通过可读、可校验的推理过程完成逻辑校准、过程验证与最终决策。 进一步地,U2引入可控隐空间展开(Bounded Latent Rollout)与熵感知切换(Entropy-aware Switching)机制,使模型能够根据推理过程中的不确定性动态调整思考方式:当隐式探索稳定时,模型保持高效推理;当不确定性升高、推理路径可能发散时,则及时回到显式思维链,通过确定性 Token 完成精准推导与结果收敛。 这意味着,U2 并不是简单缩短思维链,而是重构了模型的思考分工:把开放探索、路径规划等高消耗环节更多内化到隐空间,把逻辑验证、约束校准和结果收敛留给显式推理。由此,U2 能够在减少无效推理步骤和冗余中间文本的同时,保持复杂任务中的可靠性与可控性,实现“少 Token,深思考”。 在知识底座上,U2 进一步通过高知识密度数据精筛提纯技术,过滤重复、低质与幻觉数据,完成知识点级精炼萃取;并结合稀疏知识编码与知识蒸馏架构,压缩模型冗余参数,将高价值知识能力固化到更高效的模型结构中。 在任务执行层面,U2 引入 Agent-Harness 协同训练范式。我们认为,Harness 不应只是外部套壳,而应该与模型能力共同进化。因此,U2 将模型原生 Agent 能力提升与 Harness 迭代优化纳入同一训练闭环:一方面,Harness 根据 U2 的模型特点持续优化任务执行链路;另一方面,真实任务中产生的高质量执行轨迹,又反过来强化模型的任务规划、工具调用、过程纠错和结果验收能力。 而这一系列完整的闭环,最终要落到一套务实的训练体系上。我们没有让 U2 只盯着正确答案死记硬背,而是通过课程学习、过程监督、轨迹对比与多维奖励,教会它在复杂任务中如何规划、执行、纠错、验收。配合 Agent-Harness 协同演进,U2 能够在真实任务轨迹中持续强化长链路执行能力,真正从“能聊天”走向“能完成任务”。 三大核心能力,支撑任务交付闭环 围绕真实任务交付,U2重点强化了Reasoning、Coding和Agent三大核心能力。 在Reasoning方面,U2强调低偏差执行和长程逻辑稳定性。面对复杂、多步骤任务时,模型不仅要能回答局部问题,更要能够持续保持目标一致,动态权衡预算、时间、约束条件和可行路径,最终输出更优方案。 在Coding方面,U2不再局限于代码生成,而是面向端到端工程交付。它能够根据自然语言需求生成代码,也能够理解多文件项目结构,保持接口、依赖和调用逻辑一致,并在环境调试和自主Debug中持续推进任务完成。 在Agent方面,U2重点提升了多工具协同、长流程编排和环境交互能力。面对开放式目标,它能够拆解任务优先级,理解API能力边界,组合调用不同工具,并根据外部系统反馈调整执行策略。 这三类能力共同构成了U2的任务交付闭环:先理解和规划,再执行和协作,最后校验和交付。也正因为如此,U2更适合被放到真实工作场景中检验,而不是只停留在单轮对话或单点能力展示中。 应用场景:从单次回答到任务完成 U2 具备从需求理解到完整成果交付的自主任务执行能力,可广泛应用于以下四类典型场景: 1. 全形态界面设计 响应式网页开发: 根据设计需求生成具备生产级布局、真实导航流程和完整交互状态的多页面网站,支持一键打包部署。 移动端 Web App: 构建类原生社交应用,包括 Feed 流、Stories、发帖入口、通知、个人主页、图片网格及底部导航,所有资源本地化。 设计规范落地: 自动约束色彩、字体、间距等样式体系,同时适配 PC 与移动端,实现从视觉到代码的端到端输出。 Prompt: 参考 [anotherescape.com](https://anotherescape.com/),构建一个体现水獭和虎鲸智慧与魅力的中文网站。 要求: - 纯原生 HTML/CSS/JS,多页面(首页 + 6 个 Story 详情页),共享 CSS/JS - 内容/图片通过网络搜索获取,下载到本地 images/,不依赖图床 - 编辑式极简风格,深海蓝+米白+珊瑚橙配色,响应式 - Story 页参考 anotherescape.com 文章页结构:面包屑 → 标题/作者 → 头图 → 正文 → 分享 → 相关推荐 - 提供 package.sh一键打包为 tar.gz / zip / 图片-base64 内嵌的单文件 HTML 2. 深度研究分析 行业与政策研究: 跨平台检索并清洗多源数据,输出结构化研究报告,格式涵盖 Word、PPT 及含动态交互图表的 HTML 深度网页。 数据可视化分析: 自动生成时间轴、趋势曲线、热力图等可交互图表,支撑专家级分析与汇报。 多格式合规交付: 支持一键导出符合排版规范的文档,满足内部分享、对外汇报等不同场景。 Prompt: (上传文档)把这份 50 页 PDF 的要点与数据提出来,整理成报告,以html格式输出。 3. 沉浸式可交互游戏开发 经典休闲游戏: 独立完成算法设计、代码编写与调试闭环,交付如俄罗斯方块等可玩、可交互的 HTML5 游戏。 物理模拟器: 基于真实物理公式构建多摆混沌系统、粒子运动等模拟器,支持参数调节与实时轨迹绘制。 Prompt: 用网页做一个经典的俄罗斯方块小游戏,游戏规则和主流的一致就好,要求把所有代码都写在一个文件里,我保存后双击就能直接在浏览器里玩。游戏画面要好看一点,支持用电脑键盘的方向键来控制方块的移动和变形。还要有计分功能。 4. 高效办公自动化 经营报告分析: 跨系统抓取销售、成本、库存等核心指标,自动生成带趋势图表与异常标注的可视化看板及 Word 报告。 行业全景分析: 汇集市场格局、技术路线、政策驱动等数据,输出交互式竞争矩阵与可演示 PPT。 周期性业务复盘: 全自主编排数据清洗、交叉校验与报告生成流程,实现组织核心业务复盘的自动化。 Prompt: 请对新能源汽车行业进行全景式深度分析,包括市场规模、竞争格局、技术路线、政策环境及未来3年发展趋势,输出结构化研究报告。 要求输出PPT格式的文档,PPT的整体风格要极具高级审美,排版要清晰,信息层级明确。画面以图形、结构、色块为主。配色统一,风格一致,有视觉系统感。比例为16:9。 对云知声而言,U2 的发布不只是一次常规的模型升级,更是我们在原生智能体大模型长跑中的一次关键落子。 从榜单上的实测数据,到真实场景的交付闭环,我们希望用更高智能密度、更高Token价值,让每一次调用都转化为实实在在的生产力。 目前,U2 已经正式上线云知声Token Hub,全面面向个人、开发者及组织开放。 欢迎体验: https://maas.unisound.com/models/u2 ### 云知声-中国科大联合团队再创佳绩,斩获CVPR2026 10th ABAW国际挑战赛两冠一季 URL: https://www.unisound.com/news/152 发布时间: 2026-06-05 近日,IEEE/CVF计算机视觉与模式识别会议(CVPR 2026)公布了第十届开放环境下情感行为分析国际挑战赛(The 10th Workshop and Competition on Affective Behavior Analysis in-the-Wild,简称10th ABAW)最终成绩。 云知声与中国科学技术大学於俊副教授团队联合攻关,从全球众多参赛队伍中脱颖而出,在情绪模仿强度估计赛道(Emotional Mimicry Intensity Estimation,EMI)和动作单元检测赛道(Action Unit Detection,AU)中斩获冠军,在表情识别赛道(Expression Recognition,EXPR)中荣获季军,实现两冠一季的优异成绩。 依托竞赛中的技术创新成果,联合团队进一步完成三篇CVPR 2026 Workshop论文并公开发表,充分展现了团队在开放环境情感行为分析与多模态理解领域的领先研究实力。 CVPR会议由IEEE与CVF联合主办,是计算机视觉领域最具影响力的国际顶级学术会议之一,与ICCV、ECCV并称计算机视觉三大顶级会议。ABAW赛事作为CVPR长期举办的重要Workshop与国际竞赛,专注于开放环境(in-the-wild)下的人类情感行为分析研究,已成为全球情感计算领域最具影响力的赛事之一。 经过来自全球高校、研究机构及工业界团队的激烈竞争,云知声-中国科大联合团队凭借扎实的算法创新和工程实践能力,在多个赛道中取得优异成绩。 人类情感行为分析旨在融合视觉、语音、文本等多种模态信息,自动理解和分析人类情绪状态、行为模式及社会互动过程,是人工智能迈向自然人机交互的重要研究方向。随着多模态大模型和生成式人工智能的发展,情感行为分析在智能助手、数字人、心理健康评估、智慧教育等领域展现出广阔应用前景。 本次ABAW10竞赛涵盖了表情识别(EXPR)、动作单元检测(AU)、情绪模仿强度估计(EMI)、暴力检测(VD)、模糊犹豫识别(AH)等多个具有挑战性的任务。云知声-中国科大联合团队围绕多模态融合、长时序建模及缺失模态鲁棒学习等关键问题展开深入研究,并取得了一系列创新成果。 一、EMI赛道:文本锚定的鲁棒多模态情绪模仿强度估计 论文地址: https://openaccess.thecvf.com/content/CVPR2026W/ABAW/papers/Zhu_Anchoring_Emotions_in_Text_Robust_Multimodal_Fusion_for_Mimicry_Intensity_CVPRW_2026_paper.pdf 针对情绪模仿强度估计(EMI)任务中视觉与语音信号容易受到噪声干扰、模态缺失频繁发生的问题,研究团队提出了TAEMI(Text-Anchored Emotional Mimicry Intensity Estimation)框架。 该方法创新性地将文本信息作为稳定的语义锚点,引入Text-Anchored Dual Cross-Attention机制,以文本语义主动引导视觉与语音模态的对齐与融合。同时,通过Missing-Modality Token与Modality Dropout策略增强模型对于缺失模态场景的鲁棒性,使模型能够在复杂真实环境下稳定预测连续情绪强度变化。 实验结果表明,该方法在Hume-Vidmimic2数据集上显著优于官方基线方法,有效提升了情绪模仿强度估计的准确性与稳定性。 二、AU赛道:层次粒度对齐与状态空间建模的多模态动作单元检测 论文地址: https://openaccess.thecvf.com/content/CVPR2026W/ABAW/papers/Yu_Hierarchical_Granularity_Alignment_and_State_Space_Modeling_for_Robust_Multimodal_CVPRW_2026_paper.pdf 针对开放环境下动作单元(Action Unit, AU)检测中存在的人脸姿态变化大、时序依赖长以及音视频关联复杂等问题,研究团队提出了一种基于层次粒度对齐(Hierarchical Granularity Alignment)与状态空间模型(State Space Model)的多模态框架。 该方法利用DINOv2与WavLM两类基础模型提取高质量视觉和语音特征,通过层次粒度对齐模块实现局部肌肉运动与全局面部语义之间的精细关联。同时,引入Vision-Mamba结构实现线性复杂度的超长时序建模,并设计Audio-Guided State Space机制利用语音线索动态调节视觉状态更新过程。 该方法在Aff-Wild2数据集上取得领先性能,验证了其在真实场景情感行为分析中的应用价值。 三、EXPR赛道:面向缺失模态与类别不均衡的双分支Transformer表情识别框架 论文地址: https://openaccess.thecvf.com/content/CVPR2026W/ABAW/papers/Yu_A_Dual-Branch_Transformer_for_Affective_Computing_Tackling_Missing_Modalities_and_CVPRW_2026_paper.pdf 针对真实场景表情识别任务中频繁出现的视觉遮挡、模态缺失以及类别长尾分布问题,研究团队提出了一种双分支Transformer多模态表情识别框架。 该方法通过Dual-Branch Transformer分别建模视觉与语音特征,并利用Cross-Attention实现跨模态信息交互。同时设计Safe Attention机制解决缺失视觉输入时的数值稳定性问题,使模型能够自动退化为语音驱动决策模式。此外,采用Focal Loss缓解类别不平衡问题,并结合滑动窗口软投票策略实现长视频中的稳定情绪预测。实验结果表明,该方法能够有效提升复杂环境下表情识别系统的鲁棒性。 近年来,云知声与中国科大持续围绕多模态人工智能、情感计算以及大模型技术开展深入合作,推动相关技术在智慧医疗、智能客服、人机交互等领域的落地应用。本次10th ABAW竞赛成果充分体现了联合团队在开放环境情感行为分析领域的技术积累与创新能力。 展望未来,云知声-中国科大联合团队将继续深耕情感计算、多模态学习与人工智能基础研究,不断突破复杂真实场景下的人机情感理解能力,为构建更加自然、可信、富有情感智能的人机交互系统贡献力量。 ### 面向真实场景鲁棒多模态 AU 检测的层次化粒度对齐与状态空间建模 URL: https://www.unisound.com/research/151 发布时间: 2026-06-03 ### 面向情感计算的双分支 Transformer:通过安全注意力机制与 Focal Loss 应对模态缺失和数据不平衡 URL: https://www.unisound.com/research/150 发布时间: 2026-06-03 ### 以文本锚定情绪:面向模仿强度估计的鲁棒多模态融合 URL: https://www.unisound.com/research/149 发布时间: 2026-06-03 ### 云知声 U2-ASR 2.5上线:首个中文方言语义转写大模型 URL: https://www.unisound.com/research/147 发布时间: 2026-05-13  今年1月,云知声发布了山海·知音2.0,作为云知声面向真实语音世界打造的旗舰语音大模型,其凭借全场景ASR、高拟人TTS与全双工毫秒级响应三大核心能力,重新定义了人机交互的性能基准。 今天,历经多轮算法迭代与大规模地域语料的针对性训练,山海·知音2.0完成新一轮能力升级,正式推出 首个中文方言语义转写大模型——U2-ASR 2.5 ,全面覆盖 七大方言体系,支持100种以上方言及地方口音识别转写,方言人口覆盖率高达90%以上。 在此基础上,模型进一步打通“方言识别-语义还原-普通话表达”链路,支持将晦涩、口语化、地域化的方言表达转化为规范、准确、可理解的普通话文本,让AI不只听清方言,更能真正听懂大江南北。 最新一轮评测中,U2-ASR 2.5交出了一份足够硬核的方言识别成绩:在自有工业级方言测试集上,山海·知音整体识别效果全面超越主流ASR模型,从北方方言到西南官话,从粤语到华中口音,其多项方言识别准确率突破 90% :济南话识别准确率高达 96.2% ,四川话达到 94.7% ,粤语达到 93.0% ,武汉话达到 92.1% ,充分验证了山海·知音在口音差异显著、地域表达复杂、方言与普通话混合使用频繁等挑战性场景下,具备业内领先的方言ASR基础能力。 工业级测试集测试结果 与此同时,U2-ASR 2.5在通用中英文识别任务中同样表现强劲:在 AISHELL、FLEURS、LibriSpeech、WenetSpeech Meeting、KeSpeech 等公开测试集上,模型持续取得优异成绩,其中AISHELL-1达到 99.2% ,Libri Clean达到 98.4% ,AISHELL-3达到 98.4% 。这意味着,模型并不是在通用ASR能力之外简单叠加方言识别,而是在扎实的中英文语音识别底座上,进一步向方言这一高难场景拓展。 中英文公开测试集测试结果 而此次升级的关键突破在于,在完成方言语音转写的基础上,模型进一步引入方言词义映射、上下文意图识别与普通话语义还原能力, 能够将晦涩、口语化、地域化的方言表达,转化为更规范、更准确、更易理解的普通话文本。 01 技术解构:如何实现“方言通”? 方言识别之所以难,是因为它面对的不是一套标准化语言,而是真实世界中极其复杂的声音样本和表达方式。 不同地区、不同年龄、不同语境下,同一种方言都可能存在明显差异;同一个词,在不同地方可能发音不同、写法不同、含义也不同。再叠加录音设备差异、环境噪声、语速变化、方普混说等因素,方言ASR从一开始就不是简单的语音转文字任务,而是一项系统性的语音理解工程。 针对这一工程挑战,U2-ASR 2.5围绕数据、解码与语义理解三条关键链路进行了系统性优化: 数据:先把真实世界的声音教给模型 方言识别的难点,往往不在模型本身,而在数据。 相比普通话语料,方言数据天然面临样本分散、录音条件不一、转写标准不统一,以及同音异形、借词混说更频繁等问题。围绕这些挑战,我们构建了“真实数据收集+公开语料补充+半监督扩增+人工校准”的数据治理闭环,通过 VAD、降噪、去重、语段切分与置信度过滤等多环节处理,提升可训练数据的纯度与一致性,并结合语音合成与数据增强技术扩大样本规模。 针对同一方言内部“十里不同音”的现实,模型训练不再按方言名称做粗粒度划分,而是在统一语音底座上,通过跨区域采样与发音变体建模,让模型学习可迁移的发音规律,而非依赖少数样本的口音模板,从而在更大方言区间内保持稳定识别。 解码:在混合语境中保持连续与稳定 真实对话里,方言、普通话、英语往往不是分段出现,而是以词级、短语级形式交替穿插。为此,我们引入了更细粒度的语言边界检测,实现三大技术创新: 一是在模型输入层引入语种边界预测模块,实时预判语种切换发生的时间点;二是设计了动态语种注意力机制,在解码过程中根据当前语音特征自动调整对方言、普通话、英语三类语言模型的权重分配;三是构建了数万小时级的语种切换语料库,覆盖常见的方言-普通话混合表达模式。 从听清到听懂:语义层能力升级 此次升级不仅停留在“听清说了什么”,更进一步走向“理解在说什么”。 在完成方言语音转写的基础上,我们通过方言词义映射、上下文意图识别以及多源知识融合,对原始表达进行语义还原,输出更易理解的普通话文本。 这意味着,我们的大模型不只是逐字记录方言内容,而是能够在保留原始表达的同时,对其进行规范化解释,从而为后续的意图理解、任务执行等能力提供更清晰、可用的输入基础。 从这个角度看,U2-ASR 2.5不只是ASR模型的识别能力升级,更是语音理解能力的一次跃迁。 02 从“能识别”到“稳识别”:方言语音的工程化挑战 在真实业务中,模型不仅要识别得准,还要在噪声、设备差异、多语音并发、长时间运行等复杂条件下保持稳定。云知声更关注的,正是语音能力能否从实验室测试走向工业级落地。 围绕这一目标,U2-ASR 2.5构建了贯穿前端信号处理、模型适配、热词增强、推理优化与后端纠错的全链路工程化体系,让方言识别不仅“分数高”,更能“用得稳”。 高识别率:先赢在准确率,再赢下复杂场景 在方言语音识别中,准确率不仅取决于模型是否“听见”方言,更取决于其能否在口音差异、方普混说、口语化表达等复杂输入中稳定理解用户意图。 从官话、晋语到吴语、湘语,从赣语、闽语到客家话、粤语,U2-ASR 2.5 面向多类主要中文方言体系持续扩展能力边界,覆盖南北多区域、多语系、多口音的真实表达场景,并在代表性体系样本中展现出更稳定、更准确的方言识别能力,在自有工业级方言测试集上,其综合识别表现整体领先主流ASR 模型。 工业级测试集测试结果 同时,U2-ASR 2.5在 AISHELL、LibriSpeech、FLEURS 等中英文公开测试集上同样保持优异表现,进一步验证了其扎实的通用 ASR 底座能力。 中英文公开测试集测试结果 这意味着,U2-ASR 2.5不是只在单一方言上“刷高分”,而是在更广泛、更复杂、更接近真实世界的语音场景中持续领先。它能覆盖更丰富的地域表达,也能适应更复杂的口音差异,让方言语音识别从“可用”进一步走向“好用”。 高噪识别 : 听得懂夜市,也听得懂医院候诊区 真实世界从来不是录音棚。在早点摊、夜市、政务大厅、医院候诊区、客服中心等场景中,背景音复杂、说话人距离不一、多人声音交叠,传统 ASR 模型很容易出现漏识、错识和语义断裂。 U2-ASR 2.5在语音进入模型前,通过多通道降噪、自适应回声消除与非稳态噪声优化,对复杂声学干扰进行预处理,在压制噪声的同时尽可能保留有效语音信息。同时,结合鲁棒性建模与端点检测优化,模型能够更准确地捕捉有效语音,降低设备差异和环境噪声带来的影响。即使在高噪声、高干扰的真实场景中,也能保持较高识别稳定性。 专业增强:听得懂方言,也听得懂业务 在医疗、政务、客服等场景中,用户表达往往不只是方言,还会夹杂大量专业词汇、业务术语和专有名词。 云知声支持热词动态注入与行业词表适配,可针对医疗、政务、客服等专业场景,对高频术语、专有名词和业务关键词进行识别增强,降低误识别概率,让方言识别结果更贴近业务语义。 这也是U2-ASR 2.5区别于普通ASR模型的重要能力:不仅懂语言,也懂场景。 低延迟响应:识别更强,也要响应更快 U2-ASR 2.5通过模型量化、算子融合、流式解码与服务端并发调度优化,压缩推理链路,降低复杂方言识别带来的计算开销。同时,结合重打分与纠错机制,对人称代词混用、语气词误识、口语化表达等细粒度问题进行校验与修正,使输出结果不仅更快,也更稳定、更可用。 03 应用场景:让技术回归“人”的温度 在中国,方言依然是许多人日常交流中最自然、最熟悉的表达方式。尤其在政务、医疗、客服、适老化服务等场景中,语言习惯的差异,仍可能影响信息传递的效率与服务体验。 进入大模型时代,语音交互不应只适应标准表达,也应更好地理解真实人群的自然表达—— 智慧政务 :在基层政务窗口、便民服务终端等场景中,群众往往更习惯用方言表达诉求。U2-ASR 2.5可帮助系统更准确地理解方言表达,并转化为规范、可处理的普通话文本,减少反复沟通带来的理解成本,让公共服务更自然地触达不同地域用户。 智慧医疗 :在医院导诊、问诊记录、随访沟通等场景中,患者的口音、表达习惯和专业词汇交织在一起,容易影响信息记录与理解效率。通过抗噪声优化与医疗热词增强,U2-ASR 2.5可辅助系统更稳定地识别患者主诉和关键信息,降低因口音差异带来的沟通成本。 智慧金融保险: 在银行、保险、理赔等场景中,用户表达往往包含方言口音、口语化描述、金融保险术语与复杂业务信息,一旦关键信息识别不准,就可能影响后续核验、审核与服务效率。U2-ASR 2.5可结合方言识别、专业热词增强与语义理解能力,更稳定地识别理赔、疾病名称、赔付范围、费用明细等关键信息,并将口语化、方言化表达转化为规范、可处理的普通话文本,增强理赔材料整理与风险审核等业务的准确性、可追溯性与服务可信度。 智慧客服 :在方言使用高频区域,用户并不总是愿意或能够切换为标准普通话。面向热线客服、智能外呼、智能坐席等场景,U2-ASR 2.5可支持更自然的方言表达识别,帮助客服系统更快理解用户需求,减少重复确认,提升服务效率与交互体验。 文旅与内容创作 : 在文旅宣推、纪录片制作、地方文化记录等场景中,大量真实、生动的方言素材往往难以被高效整理和传播。U2-ASR 2.5可将方言语音转化为更易理解、可编辑、可检索的文本内容,为地方文化传播、非遗记录和内容生产提供新的技术支撑。 每一种方言,都是一套完整的意义系统,承载着当地的生活经验与文化记忆。理解方言,不只是识别一段声音,更是在复杂口音、混合表达与真实语境中,准确捕捉用户的意图。此次上线U2-ASR 2.5,正是云知声从“听清”迈向“听懂”的一次探索。 未来,云知声将持续拓展方言语音能力,覆盖更丰富的地域表达、更复杂的真实场景与更多元的人群需求,让AI真正听懂每一个人的自然表达。 ### 云知声首份年报超预期!营收大增近三成,下半年亏损大幅收窄超九成,逼近盈利,迈向原生智能体新征程! URL: https://www.unisound.com/news/139 发布时间: 2026-03-26 3月26日,云知声(09678.HK)发布截至2025年12月31日止年度的经审核全年业绩,首份成绩单展现出公司强劲的增长动能与持续优化的财务结构。 营收结构持续优化,下半年增长提速 2025年全年,云知声实现总营收 12.1 亿元人民币,同比增长 29% 。其中,下半年收入同比增长 33% ,达 8.1 大模型业务全年收入 6.1 亿元,同比增长 超10 倍。尤其是下半年,该业务贡献收入约 5 亿元,为上半年规模的 5 倍,显示出强劲的规模化落地能力。 亏损大幅收窄,盈利路径日渐清晰 在营收高速增长的同时,公司亏损状况显著改善。2025年下半年,公司净亏损同比收窄 84% ,经调整后亏损同比收窄 92% ,接近盈亏平衡点,反映出公司在成本控制与运营效率方面的持续优化。 同时,公司的部分经营指标也得到明显改善。经调整营业费用率较去年同比大幅 下降10个百分点 ,销售费用不升反降,占收入比重仅为 5.4% , 费效比提升明显 。从数据端来看,2025年公司人均产值为 252万元/人, 相较24年的202万元同比 增长25% ,人均创效能力持续领跑行业,直观彰显了公司技术驱动、精益运营的核心优势。 双轮驱动战略落地,智慧医疗与智慧生活齐头并进 2025年,在技术突破与政策红利的双重驱动下,全球人工智能市场需求持续升温。云知声坚持“ 强基模+深应用 ”战略,持续夯实全模态 技术底座, 推动自研大模型矩阵在医疗、语音、OCR等领域的全球影响力不断提升。 在商业化层面,公司以AI原生组织推动业务落地,智慧医疗与智慧生活双轮驱动战略成效显著。报告期内: 智慧生活业务 实现收入 9.68亿 元,同比增长 30.8% 。其中,智慧交通业务同比增长近 40%, 目前,已在青岛、宁波、深圳、南宁等10余个城市落地基于山海大模型的智能体应用。此外,AI芯片累计出货量突破 1.1亿颗 ,进一步验证公司在终端AI产品的规模化能力。 智慧医疗业务 实现收入 2.44 亿元,同比增长 22.3 %,客单价同比增长 53.2 %。2025 年 ,合作的医院中 超85% 为三级医院,且超过 三分之一客户 已经连续合作 三年以上 ;而基于医疗大模型的病历录入与生成产品已在某头部三甲医院单院区实现全年病历生成同比增长 10 倍;商业保险智能体平台案件处理量同比增长 37 倍;与头部保险集团的深度合作中,控费率水平有效提升至约 20% , 相较传统审核方式实现超 10亿元级别 的增量成本管控, 全面赋能保险机构在医疗风控领域的精细化运营。 持续加码研发,夯实技术护城河 为巩固行业领先地位,2025公司持续在技术端大力投入,全年研发费用 超3.8亿元 , 占经调整三费的 75% ;研发人员占比达 69% 。持续的研发投入在多个技术领域取得突破,如在MedBench 4.0评测中,公司一举斩获“医疗智能体”“医疗大语言模型”“医疗多模态大模型”三项技术范式第一,荣膺“三冠王”。 未来展望:深耕技术底座,拓展应用边界 展望未来, 云知声将继续深化“强基模+深应用”战略 。技术层面,公司将持续加大对基座大模型的战略性投入,力争保持全球一流水平;应用层面,将以MaaS(模型即服务)与智能体的规模化拓展为核心增长引擎,推动智慧生活与智慧医疗业务的指数级增长。同时,公司正积极探索以API调用、Token计费等模式构建经常性收入体系,并将C端产品机会作为第二增长曲线,进一步拓展商业化边界。 2026年第二季度末到第三季度,云知声将推出面向编程和办公的原生智能体大模型,并预计能实现智能密度和Token 生产效率的倍增。 ### 从全员配备大模型到 IDE 工具赋能,云知声开启 AI Native 组织进化 URL: https://www.unisound.com/news/140 发布时间: 2026-03-20 当英伟达创始人黄仁勋提出“数据中心是Token生产工厂”,并将行业金线划定为“每瓦Token数”时,AI产业的底层逻辑已悄然生变 。Token不再仅仅是代码深处的计量单位,它已跃升为数字世界的“硬通货” 。 在从“堆算力”到“拼效能”的范式转移中,云知声选择了一种极具远见的投资方式:与其让员工在AI焦虑中观望,不如直接将通往未来的资产——Token,交到每一位员工手中 。 生产力普惠:让每一瓦脑力都“AI化” 云知声深知,最宝贵的“数据中心”并非服务器集群,而是每一位员工的头脑 。为此,公司正式推行 全员AI赋能计划 : 研发端的“核心驱动” :全体研发人员(含算法、开发、测试、运维等)全面引入 TRAE、Claude Code 等尖端AI编程工具,并由公司承担相关费用。AI不再是辅助,而是必须掌握的“核心研发工具”,旨在实现代码生成与优化的指数级效率跃升 。 非研发端的“无限边界” :行政、市场、运营等部门同样敞开大门。在严守数据安全红线的前提下,鼓励非技术岗位自主探索AI工作流,让“每瓦Token数”这一宏观指标,微观落实到每一位员工的“每一瓦脑力”上 。 透明的成本保障 :公司设立了清晰的报销标准,涵盖国内外顶级模型,通过制度化保障消除员工的“探索成本” 。 龙虾学习营:从技能提升到认知升维 工具易得,认知难求。为了让AI能力真正内化为组织级能力,云知声内部孵化了一个去中心化的组织—— 「龙虾学习营」 。 这里不设枯燥的KPI,而是由一群自称“正经养虾人”的伙伴,通过行业干货分享、跨部门实战交流,同步最前沿的AI应用经验 。特别是近期引发行业巨变的 OpenClaw 及其Skills的使用心得,正在这里快速流转。 我们的目标是让每位员工都拥有属于自己的“AI数字分身”,从传统的劳动者进化为驾驭数字员工的“超级个体”。 构建AI Native的智能组织 在AI焦虑蔓延的当下,云知声的人才观清晰而坚定: 未来的竞争,本质上是人才密度的竞争,是人机协作深度的竞争。 “工具无法替代人,但善用工具的人,必将替代不善用工具的人。” 发放Token红包,是通向未来的入场券;报销IDE工具,是消除技术壁垒;成立龙虾营,是绘制穿越迷雾的航海图 。这一系列动作背后,是云知声作为中国AI领军企业的格局: 我们不仅在输出更智能的行业解决方案,更在内部完成一场深刻的组织进化革命。 当每一份脑力都与AI同频共振,一个由“超级个体”构成的AI Native组织,正在重新定义AI时代的竞争力边界。 云知声相信,未来的技术领袖,必将诞生于那些率先将AI融入血液的组织之中。 ### 五大医疗Skill登陆ClawHub,你的“虾”要变医学专家了! URL: https://www.unisound.com/news/138 发布时间: 2026-03-20 我们见过太多能写诗、能聊天的AI,却鲜少见能真正读懂病历、理清诊疗思路、甚至协助医保审核的医疗“智能体”。 通用大模型或许能精准识别每一个汉字,却难以穿透文本背后的 医学逻辑 ;它能生成流畅的文字,却无法判断诊断与用药是否矛盾、证据链条是否完整、是否符合 医保审核规则 。在严肃医疗场景中,真正的门槛从来不是“能读会写”,而是能否像一位经验丰富的专家那样,理解、指导、协作并承担责任。 从 “智能工具” 到 “医学专家” ,这不仅是技术的进化,更是角色的重塑。 即日起,云知声五大核心医疗Skill正式上架ClawHub社区。涵盖 医疗知识问答、门诊病历生成(初诊/复诊)、重大疾病审核、慢病审核五大能力 。这不仅是技术能力的开放,更是将一套 “活的医学逻辑引擎” 封装成可随时调用的 “智能实体” ,让AI真正具备“医学专家”的思维内核,并面向医院、保险机构、个人用户提供精准服务——而且,这些能力可以交叉使用,满足患者/家属/医生/保险机构/保险审核员等多元角色的复合需求。 01 医疗AI的真实瓶颈:不是“参数”,是“逻辑” 当前,医疗AI已走过基础识别的蛮荒期。语音转写、信息提取已成标配,但为何在核心诊疗、医保审核等关键环节,AI依旧难以获得完全信任? 因为“能读报告”和“懂临床”之间,隔着一层专业的逻辑壁垒。 一份重大疾病审核材料,往往包含门诊病历、出院小结、病理报告、手术记录等多源异构数据;一份规范病历,藏着主诉、现病史、既往史之间严谨的因果关联。 通用模型可以逐页读取文字,但它无法回答:诊断分型与用药方案是否存在冲突?关键检查的时间节点是否符合诊疗规范?医学证据链是否存在断裂或矛盾?病程记录是否逻辑连贯、合规?——这些涉及 临床思维 和 医保规则 的核心问题,才是医疗场景对AI的真实诉求。 云知声此次上架ClawHub的五大医疗Skill,基于多年深耕医疗场景、沉淀的海量临床数据与医学知识,精准打通了从“文本处理”到“临床逻辑理解”的最后一公里。更重要的是,这些Skill会 持续更新的后台知识 ——医学指南在更新、医保政策在调整,后台的“医学逻辑实体”也在同步进化,确保AI永远“懂行”。 02 五大Skill:每一位,都是你团队里的“医学专家” 区别于通用AI的基础功能,云知声五大医疗Skill完全围绕临床实际工作流设计。每一项能力,都对应着一位特定角色的“医学专家”助手,实现从“被动工具”到“主动协作者”的转变。 它们并非孤立存在,而是基于医学知识库和保险规则体系,可以相互协同,为不同用户(医院、保险、个人)提供交叉服务。 (1)医疗知识问答Skill:面向患者的“健康顾问” Skill直达地址:https://clawhub.ai/yishuihan132/medical-qa 核心能力 :面向有健康自查需求的患者,帮助理解症状含义、解读检查报告结果、了解用药常识,并给出何时就医的专业建议。系统基于权威医学知识库(含药品说明书、临床指南、检查项参考值),以温暖共情的语言风格提供亲切的口语化健康问答。 价值 :帮助用户深入了解症状背景、药品说明、病情进展,视情况主动引导就医,不提供处方建议,确保安全边界清晰。 逻辑内核 :整合了权威医学知识,可解释复杂医学术语,连接公众与专业医疗。 (2)初诊病历生成Skill:诊室里的“速记专家” Skill直达地址: https://clawhub.ai/aaiccee/med-record-gen 核心能力 :能接收嘈杂、非结构化的医患对话语音文本,依据 临床病历书写规范 ,智能提取关键诊疗信息,自动生成符合规范的结构化门诊病历(主诉、现病史、既往史等)。 价值 :问诊结束,病历草稿同步完成。医生只需核对确认,从繁琐的手工录入中解放,将时间还给诊疗本身。 逻辑内核 :内置了病历书写的医学逻辑,确保主诉与现病史的因果一致性。 (3)复诊病历生成Skill:病史管理的“档案专家” Skill直达地址: https://clawhub.ai/aaiccee/med-record-struct 核心能力 :读取非结构化的既往复诊记录,自动识别并提取其中的关键信息(如主诉变化、用药调整、检查结果等),将其转化为结构化的字段,方便医生快速回顾患者历史。 价值 :帮助医生在复诊时快速掌握患者病史演变,避免重复翻阅长篇文书;同时为临床科研和数据治理提供高质量的结构化数据。 逻辑内核 :基于病史演变规律,精准提取与门诊病历相关的核心字段,与初诊病历生成Skill形成互补,共同完善门诊病历的全流程管理。 (4)重大疾病审核Skill:理赔审核的“风控专家” Skill直达地址: https://clawhub.ai/aaiccee/critical-disease-review 核心能力 :能处理多源异构医疗资料(病历、影像、手术记录等),依据 重大疾病保险条款及医保审核规则 ,自动完成关键信息抽取、证据对齐。能发现材料间的一致性问题和证据缺失。 价值 :先读懂材料、梳理证据,再让人做决策。实现从“人工翻阅”到“智能预审”的效率跃迁,输出可追溯的审核结论。 逻辑内核 :内置了重大疾病的理赔逻辑,对诊断、手术、检查进行证据链校验。 (5)慢病审核Skill:资格判定的“准入专家” Skill直达地址: https://clawhub.ai/aaiccee/chronic-disease-review 核心能力 :围绕目标慢病类型,能自动提取疾病认定关键证据要素,完成 规则化核对与一致性校验 。 价值 :针对糖尿病、高血压等常见慢病,精准识别诊断依据与用药情况。减少重复查阅,提升审核效率与结果一致性。 逻辑内核 :基于慢病管理指南和医保准入规则,确保审核标准化。 03 协同工作:持续进化专业知识库,释放交叉价值 这五大Skill拥有持续进化的医学知识/医保规则后台。 临床指南更新、医保政策调整、新药上市——后台的“医学逻辑实体”都会同步迭代,确保所有Skill始终处于知识前沿。 更重要的是,它们可以 交叉组合 ,满足更复杂的场景需求: 个人医生(如基层全科医生): 个人医生(如基层全科医生):用初诊病历生成Skill辅助日常接诊 → 用复诊病历生成Skill整理患者历史档案,快速回顾既往病情→ 用重大疾病审核Skill快速评估患者是否符合某项重疾标准 → 用医疗知识问答Skill向患者通俗解释病情。 保险机构与医院数据互通: 保险公司调用审核Skill时,若发现证据链缺失,可精准提示补充材料;医院则可用病历生成Skill规范文书,从源头提升数据质量,间接提升后续理赔效率。 临床科研与数据治理: 复诊病历生成Skill批量处理历史病历,提取的标准化字段可直接导入分析工具,将原本以月为单位的数据治理工作缩短至天级,加速科研产出。 个人健康管理闭环: 患者用医疗知识问答Skill自查后,若需就诊,可授权将问答记录导入医院系统;接诊医生通过病历生成Skill快速获取关键信息,问诊更高效。 04 重新定义医疗AI:从功能调用,到临床核心协作者 决定医疗AI能否留下的,不是单次测试的准确率,而是长期使用过程中的 专业信任感 与 落地实用性 。 当AI不再只是处理文字的工具,而是能读懂临床逻辑、核验证据链条、输出可追溯专业结论的智能体——它便彻底完成了从“功能调用”到“医学专家”的蜕变。 此次云知声五大医疗Skill登陆ClawHub,意味着 专业化医疗AI能力正式走向开放共享 。云知声打破技术壁垒,将沉淀多年的“临床思维AI能力”,以轻量化 Skill实体 的形式开放给全行业开发者。更重要的是,这些Skill背后的医学逻辑和规则引擎将持续更新,与行业同步进化。 即日起,全行业开发者、医院、保险机构、健康管理者及个人,均可通过ClawHub官网,直达云知声医疗Skill专属页面,一键调用病历生成、医保审核、知识问答等核心医疗AI能力。让AI真正成为你工作流中的“医学专家”同事。 ### Zipper-LoRA:基于语音大语言模型(Speech-LLM)的多语言语音识别的动态参数解耦方法 URL: https://www.unisound.com/research/157 发布时间: 2026-03-19 ### 云知声三大核心Skill登陆ClawHub,文档解析+全场景ASR+TTS三重赋能智能体高效办公 URL: https://www.unisound.com/news/137 发布时间: 2026-03-12 当文档能深度“认知”业务,语音识别可精准“理解”语境,合成语音能传递温度与多元表达,AI智能体的办公赋能便有了全新可能。 即日起,云知声三款核心标准化Skill正式上架ClawHub社区,U2-doc-parser、U2-audio-file-transcriber与U2-TTS相关能力重磅开放,将高精准文档解析、业界领先的全场景ASR语音识别与高度拟人化的TTS语音合成能力注入OpenClaw生态,为开发者打造“眼明耳聪善言”的智能体工作流,让AI智能体真正看懂各类文档、听懂多元语音、说出贴合场景的话语,加速办公自动化与智能体应用从原型到工业级落地。 此次上架的三款Skill,均源自云知声在多模态交互与文档智能领域的核心技术沉淀,依托自研“大模型体系”打造,具备 企业级可靠、快速部署、无缝编排、场景深度适配 等优势,开发者可在OpenClaw中直接调用,无需自建服务、管理环境依赖,轻松为智能体装上专业“眼睛”、灵敏“耳朵”与灵动“嘴巴”。 U2-doc-parser:高精准文档解析,信息提取更精准 Skill直达地址: https://clawhub.ai/aaiccee/u2-doc-parser 作为云知声UnisoundU1-OCR大模型落地的标准化Skill,U2-doc-parser主打高精准文档解析,兼具全场景适配能力,实现了从“字符感知”到“文档认知”的质的飞跃,成为智能体处理各类复杂文档的核心“视觉”能力,尤其在医疗文书、财务报表、学术论文等专业场景表现突出。 该Skill拥有两大核心优势: 1.多项测评领先 :在多项权威评测中表现优异,在表格识别、跨页关联、微小文本检测等高难任务上优势显著。 2.语义驱动的结构理解 :首创“语义驱动+动态聚焦”策略,像人类专家一样先梳理文档结构、构建“语义地图”,精准识别标题、图表、正文的从属关系,即便面对排版混乱、图文混排、多语言混排的极端文档,也能条理清晰提取信息,彻底解决传统OCR“只读文字、不懂排版”的痛点。 在智能体工作流中,U2-doc-parser可直接将PDF、图片等多格式文档,包括拍照模糊、满屏水印、弯折的非标准文档,转化为结构化Markdown数据,无需二次处理即可供下游任务直接消费,完美适配医疗单据处理、财务报销审核、企业知识库构建等办公场景。 U2-audio-file-transcriber:全场景语音识别,从 “听字” 到 “理解事” 的交互进化 Skill直达地址: https://clawhub.ai/aaiccee/u2-audio-file-transcriber 基于云知声“山海・知音”大模型2.0打造的U2-audio-file-transcriber,是智能体的专业“听觉”核心,实现了从单纯语音转写到 语境理解、专业适配、全场景兼容 的能力跃迁,能在复杂噪音、方言口音、专业术语等高难度场景下精准识别,真正做到“不是听字,而是理解事”。 这款Skill以三大核心能力直击行业痛点: 1. 极端场景高准确率 :在复杂背景音环境下识别准确率 业内首次突破90% ,相比主流ASR模型,在复杂噪音、方言口音等高难场景下性能提升2.5%-3.6%,轻松适配室内近场、远场嘈杂、公共场景等全场景语音交互需求。 2. 多语言多方言全覆盖 :支持 30余种中文方言+14种国际语言 精准转写,无论是粤语、闽南语、上海话等晦涩方言,还是英、日、韩、泰等国际语言,均可实现高精准转写,适配多方言混切的商务会议、跨境沟通等办公场景。 3. 专业术语+上下文推理 :可针对医疗、汽车、金融等领域显式注入专业术语进行定向增强,如医疗场景的“依帕司他”“二甲双胍”、汽车场景的“半幅方向盘”,识别精度提升30%;同时具备强大的上下文逻辑推理能力,能根据语境补全未明确提及的关键信息,避免语义断裂。 在智能体工作流中,U2-audio-file-transcriber可实现会议录音实时转写、嘈杂环境下语音指令识别、专业场景对话转录、多语言语音内容解析等功能,转录结果可直接触发智能体后续动作,适配智能会议助手、语音指令办公、客户沟通智能记录等多元办公场景。 U2-TTS:声动进化,让AI说话有温度、多维度 Skill直达地址: https://clawhub.ai/aaiccee/u2-tts 依托云知声“山海・知音”大模型2.0打造的智能U2-TTS,作为智能体的“嘴巴”,以“高度拟人+创意多元”为核心,让语音合成兼具真实感与创造力,让科技的表达更有温度,完美适配智能播报、有声创作、场景化语音交互等办公需求。 这款Skill以三大核心优势让AI表达更加多元: 1. 多语种多方言全覆盖,表达更贴合场景 :支持多种中文方言与国际语言的语音合成,粤语、四川话等方言还原地道,日语“促音”、泰语“声调变化”等小语种语音韵律经过专项优化,合成自然度接近母语使用者,适配文旅宣传、跨境办公沟通、方言场景播报等需求。 2. 情感与风格多元,还原真实人际表达 :可切换12种普通话风格,温柔、干练、亲切等风格随心选择,还能自然还原笑声、呼吸声等细节,实现高兴、沉稳、急切等多情感表达,让AI的语音输出贴合不同办公场景的情绪与氛围需求。 3. 高效创作与低延迟交互,适配办公全流程 :支持一句话声音复刻,可融合不同样音的音色与情感特征生成定制化音频,赋能办公场景下的有声内容创作、视频配音、儿童伴读等需求;同时依托纯因果注意力机制的流匹配模块与端到端纯流式推理架构,在不损失合成质量的前提下显著降低系统延迟,低并发场景下首包延迟压缩至90毫秒以内,达到业界领先的实时交互水平,适配智能语音播报、实时语音回复等低延迟办公需求。 在智能体工作流中,智能U2-TTS可将智能体的文字输出转化为自然、贴合场景的语音,实现智能会议纪要语音解读、报销流程语音提醒等功能,让智能体的交互从“文字”延伸到“语音”,提升办公场景的交互效率与体验。 快速集成 + 无缝编排,开发者轻松打造工业级智能体 云知声三款Skill专为OpenClaw生态打造,最大化降低开发者的集成与使用成本,让智能体开发从“能用”走向“好用”: 1.企业级可靠性,告别Demo阶段 三款Skill均来自云知声真实商业业务沉淀,经过医疗、金融、办公等多场景大规模验证,提供稳定可预期的效果输出与官方持续维护、版本演进,让智能体真正走出Demo,落地工业级生产环境。 2.快速部署,开箱即用 开发者可以在OpenClaw中以标准化Skill节点直接调用,一键为智能体注入文档解析、语音识别与语音合成能力,无需投入大量精力进行技术研发与环境搭建。 3.无缝编排组合,打造定制化智能工作流 三款Skill可与ClawHub生态内其他能力自由组合、灵活编排,成为智能体开发的“能力积木”,轻松构建定制化办公智能体: 智能会议助手 :U2-audio-file-transcriber转录会议录音提取关键信息,U2-doc-parser解析会议PPT、报表等文档,智能体自动关联语音与文档内容生成结构化会议纪要,再通过智能U2-TTS将纪要语音解读,将1小时的整理工作缩短至数分钟,实现会议全流程智能化。 医疗单据处理智能体 :U2-doc-parser高精准解析医疗发票、费用清单、入院记录等单据并提取结构化数据,结合业务规则完成合规校验,再通过智能U2-TTS语音播报审核结果,实现医疗单据自动化处理与语音反馈。 财务报销智能体 :U2-doc-parser识别报销发票、清单关键信息并校验,U2-audio-file-transcriber接收员工语音报销说明,智能体自动生成报销申请单,最后通过智能U2-TTS语音提醒报销进度,实现“拍照+语音”的极简报销流程。 从高精准文档解析到全场景语音交互,再到拟人化语音合成,云知声此次将三大核心能力以标准化Skill形式登陆ClawHub,是其AI技术在开源生态的重要落地,更是为办公自动化、智能体开发提供的全方位核心能力支撑。云知声始终秉持“真正的智能,不是炫技,而是融入生活”的理念,与OpenClaw生态携手,让更多高效、智能的AI智能体应用落地千行百业,重构智能办公新效率。 即日起,开发者可通过ClawHub官网直达相关Skill地址,一键调用云知声高水准的文档解析、ASR语音识别与TTS语音合成能力,轻松打造“眼明耳聪善言”的智能体工作流! ## 开发者资源 - 产品目录(机器可读): https://www.unisound.com/.well-known/product-manifest.json - API 文档: https://maas.unisound.com/ ## 联系方式 - 商务合作: bd@unisound.com - 市场公关: marketing@unisound.com - 投资者关系: ir@unisound.com Sitemap: https://www.unisound.com/sitemap.xml