旋转位置编码的外推能力增强:NTK缩放与YaRN
技术领域:位置编码 / 长文本外推RoPE(Rotary Position Embedding)当前占据主导地位,但直接外推到训练长度之外的
更新时间:2026-08-03
技术领域:位置编码 / 长文本外推RoPE(Rotary Position Embedding)当前占据主导地位,但直接外推到训练长度之外的
技术领域:模型合并 / 增量学习将多个微调后的模型合并为一个多能力模型,无需额外训练。主流方法包括任务向量(T
技术领域:RLHF / 对齐技术RLHF使大模型能够遵循人类偏好。其技术链条包括偏好收集、奖励建模、强化学习优化
技术领域:模型架构 / 稀疏计算MoE(Mixture of Experts)通过条件计算大幅扩展模型参数而不成比例增加计算量。路
技术领域:生成模型 / 扩散采样加速扩散模型的生成过程通常需要数百步迭代,DDIM(Denoising Diffusion Implicit
2026年5月,Figure AI的三台F.03人形机器人在真实物流流水线上进行了一场前所未有的持续直播:原计划8小时,在三
高通AI250是2026年至2027年AI推理芯片赛道最受关注的架构创新之一。该芯片首次在数据中心级AI推理场景中引入近存计算(Near-Memory Computing)创新内存架构,通过提供超过10倍的有效内存带宽提升并显著降低功耗,为AI推理工作负载带来跨世代的性能与能效突破。
2026年5月21日,AMD正式发布锐龙AI Max 400系列处理器(代号Gorgon Halo),其核心突破在于首次在x86平台上实现最高192GB的统一内存配置,一举打破此前128GB的容量天花板。统一内存架构的核心优势在于CPU、GPU与NPU共享同一内存池,无需在芯片间反复搬运数据。在这一架构下,用户可将高达160GB直接分配给集成显卡作为显存使用,使该处理器成为全球首款能在本地端运行3000亿参数以上超大语言模型的x86客户端芯片。
谷歌同期发布的Gemini 3.5 Flash引发了更直接的行业震动。该模型被定位为轻量级(Flash),却在MCP Atlas这一Agent基准测试上取得了83.6%的SOTA水平,超越了GPT-5.5的75.3%和Claude Opus 4.7的79.1%。这意味着一个Flash级模型在“干活能力”上已经逼近甚至超过了许多竞品旗舰。
谷歌发布了Gemini Omni,将其定义为“世界模型”向前迈出的关键一步——AI正从预测文本转向模拟现实。Omni构建在全模态架构基础之上,融合了谷歌三大核心技术底座:Gemini基座模型的理解能力、Nano Banana的图像生成能力、Veo的视频生成能力。
Cohere发布Command A+,这是该公司首个MoE架构大模型,总参数规模2180亿、激活参数250亿,采用Apache 2.0许可证实现真正意义上的开源,而非行业常见的带限制性条款的“开放权重”。
DeepSeek宣布其旗舰模型V4-Pro的API调用价格永久下调75%,输入端(缓存命中)价格降至每百万Tokens仅0.025元,刷新中国全球同类服务最低定价纪录。
5月中旬,至简动力联合北大、港中文提出了LaST-R1——一种新的具身智能强化学习框架,首次将“隐空间物理推理”塞进强化学习的优化闭环。在LIBERO仿真基准上,1条轨迹预热后平均成功率达到99.9%;真实任务中比当前最强模型π0.5高出22.5%。它的核心思路是:机器人不应只是“记住了动作轨迹”,而应该在物理世界里“先想明白再行动”。
智谱联合TileRT推出GLM-5.1高速版API,输出速度达到400 tokens/s,刷新全球大模型厂商标杆。更值得关注的是背后的技术——他们用一套全新设计的推理引擎,打破了过去“高性能模型必然高延迟”的行业天花板。
5月22日,阿里千问旗舰模型Qwen3.7-Max正式上线,全球综合排名第五、国产第一。最硬核的不是分数——它在一个从未接触过的新芯片平台上,自主编程35小时,完成了一颗核心推理内核的性能优化,最终拿到了10倍加速。