U2 Flash

为真实生产任务而生

灵活思考、持续执行,面向真实业务场景稳定完成复杂任务

U2 Flash

U2 Flash:为真实生产任务而生

U2 Flash 聚焦Agent 与 Coding核心场景,具备强大的复杂推理、代码生成与任务执行能力,支持长上下文,可胜任复杂工程开发、长程任务及多步骤Agent 工作流。在保持强劲模型能力的同时,实现更快的推理速度与更优的成本效率,为开发者与企业提供高性能、高性价比的智能底座。

核心亮点

高智能密度基座

300B规模模型实现高效参数利用,支撑长程复杂任务、工程级代码开发等高难度场景,同时兼顾模型性能与部署成本。

长程任务能力

面对复杂任务与执行障碍,主动尝试不同思路与解决路径,持续寻找可行方案,让任务更容易跑通、跑稳。

自主闭环演进

采用自我演进优化范式,支持模型自主纠错与迭代调优,减少对大量人工标注的依赖,持续迭代升级模型能力。

自主闭环演进机制

双轨数据生成

给定一批任务,由多个强模型(teacher)产出正确的轨迹路径,单个弱模型产出错误的轨迹路径,形成“对错成对”的训练样本。

监督分析与关键action标记

一个监督模型配合hamess,对成对的对错轨迹进行对比分析,生成分析报告与流程图,并在核心的决定性action上做标记。

提示CoT生成

基于关键action标记,生成对应的提示词与思维链(CoT),引导弱模型关注自身的薄弱环节。

弱模型重采

弱模型基于提示CoT重新采集、生成正确轨迹。

清洗重写

对采集到的轨迹进行提示词与思考过程的清洗和重写,提升数据质量。

微调增强(SFT+异步Agent RL+OPD)

用清洗后的高质量数据对弱模型进行SFT微调,再经异步Agent RL在真实沙盒环境中强化策略,最后通过多教师 OPD将领域专家能力蒸馏回统一模型,得到增强后的模型;增强模型作为下一轮的弱模型继续迭代,形成闭环。

在真实环境中“自己强化”

异步采样

多个rollout worker并行在沙盒环境中执行任务、采集轨迹(代码执行、工具调用、环境交互),不阻塞策略更新,大幅提升训练吞吐。

GRPO 策略优化

基于 DeepSeekMath 提出 GRPO (Group Relative Policy Optimization)在同一组轨迹内做相对优势估计,无需独立价值模型(Critic),显著降低显存与训练成本;组内多样化的多条轨迹相互比较,天然鼓励模型探索不同解法路径,摆脱单一重试模式。

稀疏奖励+长程信用分配

Agent任务奖励稀疏(只有最终结果有信号),通过关键action标记与轨迹级优势估计,把成功/失败信号沿着决策路径回溯分配到决定性动作上,解决长程信用分配难题。

监督模型仅在关键步骤介入

与自主闭环机制一脉相承——模型自主探索,监督模型只在关键分叉点介入,兼顾探索效率与训练质量。

多教师在线策略蒸馏

领域专家训练

针对数学/代码/Agent/指令跟随等不同领域,各训练一个领域专家(SFT打底+ 领域专属GRPO),形成专家池。

多教师合并

将N个领域专家作为教师,蒸馏进一个统一的学生模型。学生在自己的 on-policy 轨迹上最小化与各教师的reverseKL散度。

工程化落地

教师权重按需加载、只缓存hidden states、按教师排序样本--在有限算力下也能完成多教师蒸馏。