2026-05-25 16:56:30

高通AI250:近存计算架构对“内存墙”瓶颈的系统性破解

高通AI250是2026年至2027年AI推理芯片赛道最受关注的架构创新之一。该芯片首次在数据中心级AI推理场景中引入近存计算(Near-Memory Computing)创新内存架构,通过提供超过10倍的有效内存带宽提升并显著降低功耗,为AI推理工作负载带来跨世代的性能与能效突破。

2026-05-25 16:56:14

AMD锐龙AI Max 400:x86平台统一内存架构的本地化大模型新范式

2026年5月21日,AMD正式发布锐龙AI Max 400系列处理器(代号Gorgon Halo),其核心突破在于首次在x86平台上实现最高192GB的统一内存配置,一举打破此前128GB的容量天花板。统一内存架构的核心优势在于CPU、GPU与NPU共享同一内存池,无需在芯片间反复搬运数据。在这一架构下,用户可将高达160GB直接分配给集成显卡作为显存使用,使该处理器成为全球首款能在本地端运行3000亿参数以上超大语言模型的x86客户端芯片。

2026-05-25 16:55:57

Gemini 3.5 Flash:轻量级模型的Agent性能颠覆

谷歌同期发布的Gemini 3.5 Flash引发了更直接的行业震动。该模型被定位为轻量级(Flash),却在MCP Atlas这一Agent基准测试上取得了83.6%的SOTA水平,超越了GPT-5.5的75.3%和Claude Opus 4.7的79.1%。这意味着一个Flash级模型在“干活能力”上已经逼近甚至超过了许多竞品旗舰。

2026-05-25 16:55:39

谷歌Gemini Omni:世界模型从“感知”到“物理模拟”的架构跃迁

谷歌发布了Gemini Omni,将其定义为“世界模型”向前迈出的关键一步——AI正从预测文本转向模拟现实。Omni构建在全模态架构基础之上,融合了谷歌三大核心技术底座:Gemini基座模型的理解能力、Nano Banana的图像生成能力、Veo的视频生成能力。

2026-05-25 16:55:22

Cohere Command A+:Apache 2.0真开源与MoE量化工程突破

Cohere发布Command A+,这是该公司首个MoE架构大模型,总参数规模2180亿、激活参数250亿,采用Apache 2.0许可证实现真正意义上的开源,而非行业常见的带限制性条款的“开放权重”。

2026-05-24 07:56:45

LaST-R1:让机器人学会“先想清楚再动手”

5月中旬,至简动力联合北大、港中文提出了LaST-R1——一种新的具身智能强化学习框架,首次将“隐空间物理推理”塞进强化学习的优化闭环。在LIBERO仿真基准上,1条轨迹预热后平均成功率达到99.9%;真实任务中比当前最强模型π0.5高出22.5%。它的核心思路是:机器人不应只是“记住了动作轨迹”,而应该在物理世界里“先想明白再行动”。

2026-05-24 07:56:22

GLM-5.1高速版:400 token/s,把推理引擎重写了一遍

智谱联合TileRT推出GLM-5.1高速版API,输出速度达到400 tokens/s,刷新全球大模型厂商标杆。更值得关注的是背后的技术——他们用一套全新设计的推理引擎,打破了过去“高性能模型必然高延迟”的行业天花板。

2026-05-24 07:55:09

Qwen3.7-Max:一个35小时自主进化的AI智能体

5月22日,阿里千问旗舰模型Qwen3.7-Max正式上线,全球综合排名第五、国产第一。最硬核的不是分数——它在一个从未接触过的新芯片平台上,自主编程35小时,完成了一颗核心推理内核的性能优化,最终拿到了10倍加速。