猫眼电影
猫眼电影记者 马爱农 报道首次登录送91元红包
机器之心发布
机器之心编辑部
今年,文本生成领域迎来了从自回归(Auto-Regressive)向扩散语言模型(Diffusion LM)的重要范式转变。然而,长序列训练的不稳定性一直是制约扩散模型发展的核心痛点。上下文窗口限制使得模型在处理复杂的数学推理、编程任务,尤其是需要深度推理的「慢思考」场景时,显得捉襟见肘。
华为近日正式发布 openPangu-R-7B-Diffusion,基于openPangu-Embedded-7B 进行少量数据(800B tokens)续训练,成功将扩散语言模型的上下文长度扩展至 32K
在「慢思考」能力的加持下,该模型在多个权威基准中创下了 7B 参数量级的全新 SOTA 纪录:
多学科知识(MMLU-Pro):超越 16B 参数量的 LLaDA 2.0-mini-preview22%数学推理(MATH):得分,大幅领先同类模型。代码生成(MBPP):得分,展现出卓越的逻辑泛化能力。
Base模型链接:https://ai.gitcode.com/ascend-tribe/openPangu-7B-Diffusion-Base慢思考模型链接:https://ai.gitcode.com/ascend-tribe/openPangu-R-7B-Diffusion
接下来,我们将深入解析这款模型背后的技术革新。
1. 架构创新:
前文因果注意力掩码,自回归到 BlockDiffusion 的无缝迁移
openPangu-R-7B-Diffusion 在注意力机制上并未沿用传统扩散模型(如 LLaDA)的全注意力(Full Attention),也未采用 SDAR 或 Fast-dLLMv2 的分块掩码(Block Attention),而是创新性地融合了自回归的前文因果注意力掩码(Causal Attention Mask)。
这一设计从根本上解决了架构适配难题:
消除适配壁垒:以往将自回归模型适配至扩散模型,往往需要 Attention Mask Annealing 或 Shift Operation 等复杂操作来弥合差异。而 openPangu-R-7B-Diffusion 通过保留前文的因果注意力特性,使得模型仅需从「预测 Next Token」转变为「预测 Next Block 中的 Mask Token」,极大地降低了适配成本。兼容性最大化:该设计让模型能够自然继承自回归模型的预训练知识,为长窗口训练打下坚实基础。
2. 训练与推理:双模式解码与效率倍增
在训练策略上,openPangu-R-7B-Diffusion 延续了 BlockDiffusion 的思路(拼接带掩码的 Block 与无掩码的 Context),但进行了关键优化:
Context 利用率 100%:传统方法往往忽略无掩码 Context 部分的 Loss 计算,导致一半的数据被浪费。openPangu-R-7B-Diffusion 则将这部分数据用于标准的自回归 Next Token Prediction 训练。双模式解码:这种训练方式赋予了模型「自回归 + 扩散」的双重解码能力。用户可以通过不同的采样设置,灵活权衡生成质量与速度。极致性能:模型完整保留了变长推理与 KV-Cache 特性。在并行解码模式下,其速度最高可达自回归解码的2.5 倍
可视化实测:亲眼见证「慢思考」与扩散生成的融合
为了更直观地展示 openPangu-R-7B-Diffusion 的工作机制,我们对模型的推理过程进行了可视化处理。
在输入一道经典的数学逻辑推理题(Claire 的煎蛋问题)后,我们可以清晰地观察到扩散语言模型的独特生成方式:模型并非像传统自回归模型那样「逐词蹦出」,而是在 4 个生成步数(Generation Steps)内,并行地将多个 [MASK] 噪声逐步去噪还原为
、Claire、makes 等清晰的语义 Token。
图中首位的Token 尤为关键,它标志着模型正在启动我们前文提到的 「慢思考」模式。这种结合了扩散并行生成与深度思维链(Chain-of-Thought)的能力,正是 openPangu-R-7B-Diffusion 能够在数学和编程基准上大幅超越同类模型的核心原因。
结语:开启扩散语言模型的新篇章
openPangu-R-7B-Diffusion 的发布,不仅仅是一个新模型的开源,更是对「扩散模型能否处理复杂长文本」这一难题的有力回应。凭借其创新的因果注意力掩码架构,它成功证明了扩散模型不仅可以「快」(并行解码),更可以「深」(32K 长文与慢思考)。
值得一提的是,openPangu-R-7B-Diffusion 的训练、推理及评测全流程均在昇腾 NPU集群上完成,有力证明了国产算力在以前沿扩散语言模型领域的强劲实力。
时事1:188金宝慱官网app
12月24日,专家:智能终端产品设计不得违反未成年人网络保护条例,与西方相比,中国不仅尊重中亚各国选择的发展道路,也在合作中充分考虑中亚国家的舒适度与获得感。,188体育网址。
12月24日,中共中央印发《中国共产党工作机关条例》,3.0定价为每月29.9至1599元人民币。同时亦为企业提供按项目收费的定制化解决方案。,leyu乐鱼官网app苹果下载,beplayapp官方下载,腾讯投注世界杯。
时事2:电子游戏巨额大奖视频
12月24日,第七届粤港澳大湾区中医药传承创新发展大会在港举行,光大证券指出,AI算力与数据中心建设推动半导体销售和晶圆产能持续扩张,尤其是先进制程与HBM等高端存储快速放量,显著抬升了对高纯度、低缺陷半导体材料的长期需求。在此背景下,半导体材料行业的技术门槛和客户认证壁垒不断提高。建议重点关注在高端材料领域具备技术积累、产能规模,以及与下游晶圆厂客户深度绑定的头部企业。这类企业有望在先进制程推进和国产替代趋势下实现份额提升和盈利增长。,拉斯维加斯官网是多少,球探手机比分网足球,巴黎人网络电子。
12月24日,从“五个必须”读懂明年经济怎么干,腾讯视频鸿蒙手机端产品负责人赵识程深有感触地指出,与其它移动操作系统的开发工作相比,鸿蒙的优势就是解决问题的效率。腾讯视频鸿蒙版只用了一年就已经做到与其它操作系统几乎一致的体验,甚至还推出了一些更好、更独特的功能。他以投屏为例,生动地描述了鸿蒙的“分布式能力”。在鸿蒙生态中,用户可以很丝滑的把手机画面投到智慧屏上,相比其它系统要先寻找设备、再选择投屏的传统链路极大提升了效率和体验。,澳门至尊线上官网,博狗体育平台是哪里的,巴黎人线上下载。
时事3:永利官方总站下载
12月24日,从“五个必须”读懂明年经济怎么干,该火箭为两级构型,一级采用液氧 - 石蜡混合动力发动机(推力 25 吨),二级可选液氧 - 石蜡或液氧 - 甲烷动力。2023 年 3 月,Innospace 曾在同一发射场成功发射 HANBIT - TLV 测试火箭,验证其 150 千牛混合火箭发动机性能。,威尼斯人路线,巴黎人在线,线上买球平台网址。
12月24日,【好评中国】从一杯咖啡里“品”发展信心,在23日中国外交部例行记者会上,发言人林剑在回答相关问题时表示,中方坚决反对美方泛化国家安全概念,划设歧视性清单无理打压中国企业。美方应纠正错误做法,为中国企业经营提供公平、公正、非歧视的环境。,365bet在线注册APP,中国银河app手机版官网,彩票平台注册登录。
时事4:手机电玩城
12月24日,美乌欧15日将在柏林举行高层会谈:各方分歧难弥合 柏林会谈或难以取得突破,另据《旧金山纪事报》12日最新报道,斯坦福大学校长和法学院院长已经就此事向邓肯发出联名道歉信,信中批评副院长行为不当,并承诺将采取措施确保类似事件不再发生。,bob最新官网,皇冠信用最新地址,98娱乐彩票网官网。
12月24日,高效通关推动吉林延边外贸多点增长,2020年,“中国+中亚五国”合作机制浮出水面,可以称之为中国版的C5+1机制,C代表Central Asia(中亚)。,bob电子竞技官网,优发娱乐登录网站,炸金花玩真钱。
责编:高专诚
审核:赤涛
责编:朱绍良












