内存价格12个月暴涨500%,AI推理速度成新战场
内存价格飙升500%,DRAM成硬通货,AI训练与推理成本受冲击;同时OpenAI放缓前沿训练,开源模型与推理基础设施加速发展。
[AINews] 内存价格12个月暴涨500%内存危机持续——摩尔定律倒退回2007年水平尽管Sama持续推进“Great Pacing”,Etched成为双独角兽,Cerebras宣布CS4能以1000 tok/s运行10T参数模型,
但自我们2月发布SemiAnalysis播客以来,内存短缺问题有增无减。据Tom's Hardware报道:我们已正式陷入困境。如果你正在阅读这个网站,你几乎不可能不知道内存价格已完全脱离现实。
有人称之为“RAMpocalypse”;我更喜欢“RAMageddon”。没错:128GB DDR5套件的价格比我们见过的最低价格贵了整整十倍。事实上,情况如此严峻,据报道,超大规模买家已锁定2027年全球几乎所有的DRAM产能,并支付预付款以保证其珍贵的DRAM供应。
DRAM现在按重量计算是全球价值最高的商品之一;主流DRAM芯片每公斤的价值超过纯金的一半。换句话说,推动所有硬件单价下降的著名摩尔定律,在内存领域已经逆转:AI新闻,2026年8月17日至8月18日。
我们检查了12个subreddits、544个Twitter账号,没有其他Discord。AINews网站可搜索所有历史期刊。提醒您,AINews现在是Latent Space的一部分。您可以选择订阅或退订邮件频率!
AI Twitter回顾OpenAI暂停前沿RL训练、扩大监控,转向“控制前沿节奏”OpenAI放慢前沿训练以加强安全和对齐控制:当天最大的系统/安全动态是OpenAI表示暂停部分前沿RL训练两周,并仍在进行其计划中最大规模的前沿RL训练,同时加强监控、隔离和红队测试。
Sam Altman将此描述为能力超越安全/对齐准备度的案例,而Greg Brockman强调,对安全的信心将日益决定前沿扩展的节奏。OpenAI还澄清,放缓主要影响更远期的发布,而非已接近发布的模型。
具体控制比广泛信息更重要:OpenAI分享了比平时更多的实施细节,包括更强的工作负载/网络隔离、持续安全测试和多阶段监控。
二手评论强调了有趣的运营细节:监控可能增加约20%开销,采样token监控可在约30分钟内通知安全/安保/研究团队,且针对高风险系统的工具使用推理可能附带主动监控器(据@eliebakouch)。
无论人们对政策框架看法如何,值得注意的是,这公开承认训练/评估基础设施和推理时监控器已成为前沿进展的瓶颈,而不仅仅是原始算力。开放模型:Qwen3.8-27B势头强劲,GLM-5.
3的训练后收益与小模型之争Qwen3.8-27B成为本地/开放模型讨论的焦点:多个帖子将Qwen3.8-27B视为新的“本地可运行的前沿”时刻,@kimmonismus称其为“DeepSeek时刻”,阿里巴巴Qwen庆祝其在四天内成为Cline本地模型第一名。
帖子中引用的基准包括Artificial Analysis的Agentic Index第7名(27B)、Vals Index v2开放权重模型第6名、Harvey法律基准开放权重第1名,以及Cline将其评为新的顶级本地模型。
反对声音同样强烈:@scaling01认为基准胜利相对于Opus 4.5在实际编码使用中被夸大,凸显了基准成功、成本效率和长任务定性可靠性之间日益扩大的差距。
强大本地模型的安全影响越来越难以忽视:@kimmonismus的一篇高互动帖子指出,Qwen3.8-27B的“去除拒绝”MLX构建可在Apple Silicon上以2/4/6/8位变体本地运行,声称保留视觉、推理、工具使用和262K上下文,且拒绝率接近零。
撇开修辞不谈,这是指向真正转变的最清晰线索:有用、可本地部署、部分未经审查的模型不再是假设。GLM-5.3看起来是训练后/基础设施的故事,而非基础模型故事:Z.ai通过API推出GLM-5.3,用于编码、防御性网络和长期智能体,价格与GLM-5.2相同。
Artificial Analysis报告称,GLM-5.3在Intelligence Index上与Kimi K3并列60分,在GDPval-AA v2上跃升246分至1770 Elo,同时保持753B总/40B活跃MoE规模、1M上下文,权重发布后采用MIT许可证。
技术上最有趣的解释来自@ZhihuFrontier转发的知乎长文:GLM-5.3的收益似乎源于更强的后训练,尤其是异步RL(SAO)、可执行沙箱训练,以及防止灾难性遗忘的on-policy蒸馏。
如果属实,这为“智能体能力扩展正从参数数量转向RL系统+环境质量”的观点提供了有意义的数据点。
推理与系统基础设施:Mojo开源、TensorRT Connect、Cursor的Git存储、更快的解码Mojo现已在Apache 2.0下开源:Modular的公告引起广泛关注,公司正式开源Mojo,
并将其更广泛平台定位为跨加速器(包括高通数据中心AI加速器)的可移植层。对基础设施工程师而言,其意义更多是工具链开放性与硬件抽象的结合,而非“新语言炒作”。
NVIDIA将模型到TensorRT部署压缩为“两个命令”:NVIDIA推出TensorRT Model Connect公开预览,承诺从支持的Hugging Face模型直接转换为端到端TensorRT推理,无需中间ONNX导出,输出可通过原生C++ API部署。
该帖子还声称,该项目本身主要由Codex智能体在人工审查下构建,这与其说是营销,不如说是另一个信号:基础设施/工具团队现在愿意承认智能体辅助涉及实现、调优、测试、集成和文档。
Cursor发布了一篇关于大规模Git托管的强有力基础设施回顾:按互动量计算,最突出的系统帖子是Cursor关于“像设计数据库一样”设计Git存储的文章。
这与AI相关而非特定于模型,但对任何构建编码智能体后端的人都高度相关:随着智能体放大仓库变更、后台自动化和分支/会话激增,Git托管成为核心AI基础设施依赖,而非通用DevOps原语。
快速解码和加速器宣称不断升级:端侧推理获得显著提升,DFlash 2声称Qwen3.8-27B在M5 Max上达到70 tok/s,自回归解码速度提升至4.6倍,“输出相同”。
数据中心方面,Cerebras宣布CS-4,后续宣称10T模型达1000 tok/s,GPT-5.6 Sol约1300 tok/s,每MW吞吐量提升高达10倍。即使考虑供应商宣传,主线清晰:推理速度正同时成为产品体验、经济性和国家竞争力政策。
智能体框架、评估与生产反馈循环Miles v0.
1是面向LLM和多模态模型的全新开源RL栈:@radixark宣布Miles,一个历时9个月构建的开源RL框架,拥有72位贡献者、1,326次提交和85个GPU E2E CI测试,据称已在Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2、
Inkling和MiniMax H3等模型上经过实战检验。其卖点很实际:启动RL运行很容易,但调试正确性、利用率和规模才是真正的瓶颈。这契合当天更广泛的主题:前沿正从“谁拥有PPO/GRPO”转向“谁拥有稳健的rollout、CI、可观测性和环境管道”。
智能体搜索基准测试正在成熟:Artificial Analysis推出Search Index,在固定框架中将提供商与GPT-5.6 Lun进行比较。