Grok 4.6发布,AI队友赛道迎来最强新玩家
xAI发布Grok 4.6,以高性价比和强大智能体能力成为知识工作领域的有力竞争者,同时Qwen3.8-Max、DeepSeek V4 Pro等开源模型密集发布,AI战场转向智能体与效率。
[AINews] SpaceXAI Grok 4.6和Grok @BotAI队友类别刚刚迎来了迄今为止最重要的新进入者。我们今年反复出现的重要主题之一是编码智能体突破边界进入知识工作领域,很明显,AI队友/多人协作/多智能体空间是下一个大型AI战场。
随着Claude Tag发布后评价褒贬不一,Block的Buzz又需要更技术性的用户,这个领域仍然缺少新的类别领导者,而现在的Cursor→SpaceX团队巧妙地推出了产品并获得了非常积极的评价:
这由他们的最新模型Grok 4.6驱动,该模型今天发布,可以说是世界上第二好的知识工作模型(正如竞争对手Cognition和Elon所承认的那样)……尽管从效率上看,它肯定是最顶尖的:Grok 4.6是已确认的1.5T参数模型,"在Grok 4.5的基础上构建,
特别关注长期运行的智能体以及更宏大的交互式和视觉工作"。唯一的训练披露可以完整复述(强调为我们所加):Grok 4.6进行了比Grok 4.5更长的补充训练,使用了精选的模型生成数据用于推理和高级技术概念、高质量的工程数据,以及改进的优化器和训练方案。
这为后续的SFT和RL阶段奠定了更坚实的基础。然后我们使用Grok 4.5来重新生成跨推理努力、智能体框架以及STEM、软件工程和知识工作等领域的SFT轨迹,并通过基于模型的检查过滤掉有问题的轨迹。
由此产生的SFT checkpoint显示出强大的性能和改善的行为。Grok 4.6在广泛的智能体RL任务上进行了训练,包括知识工作、通用编码以及内核优化、Web开发、计算机辅助设计等特定领域环境。
目前尚不清楚训练Grok 4.6时缺乏沙箱逃逸事件是对其基础设施工程师的证明,还是对其研究人员的控诉。(这是对当前事件的一个玩笑,别生气)
AI新闻,2026年8月11日至8月12日。我们检查了12个subreddits、544个Twitter账号,没有进一步的Discords。AINews的网站允许您搜索所有过去的问题。提醒一下,AINews现在是Latent Space的一部分。
您可以选择加入/退出电子邮件频率!
AI Twitter回顾前沿模型日:Grok 4.6、Qwen3.8-Max、DeepSeek V4 Pro和微软的MAI-Thinking-1Grok 4.6在性价比上达到前沿:xAI发布了Grok 4.6,被描述为在相同价格下比4.5有重大进步。
Artificial Analysis的独立评估将其在智能指数上评为61分,大致与GPT-5.6 Sol Max持平,落后于Claude Opus/Fable,但智能体表现强劲,包括在Terminal-Bench v2上达到88.4%。
此外,GDPval-AA v2 Elo为1753,AA-Briefcase性能具有竞争力,但成本低得多(AA-Briefcase注释)。来自Code Arena的早期竞技场数据也将其在web开发任务上定位在GPT-5.6 Sol和Claude Fable附近。
定价是一个核心主题:AA强调每100万输入/输出token为2美元/6美元,大大低于前沿同行,而从业者立即将其视为编码和错误查找工作负载的新默认选择(Pawel Huryn,Cognition在Devin中的可用性)。
xAI表示,这些收益来自于更长的补充训练运行、重新生成的SFT轨迹,以及针对编码、Web、CAD和内核优化的智能体RL;他们还报告了在长时间任务中更多的自我测试行为(@kimmonismus摘要)。
Elon还表示Grok 4.7已经在进行中,初始训练已完成,并计划对SpaceX内部数据进行补充训练。Qwen3.8-Max开放权重已发布:阿里巴巴的Qwen3.8-Max以开放权重形式发布,总参数2.4T,激活95B的MoE。
社区评论强调其规模、首日服务以及长上下文/智能体导向:Yuchen Jin称其为迄今为止最大的开放权重发布之一;vLLM提供了首日支持,并为NVIDIA B300和AMD MI355X提供了供应商特定的4位checkpoint;
Together AI和Baseten也宣布了即时支持。用户的一个重要注意事项:发布的开放权重变体似乎是纯文本的,初始版本中没有视觉输入(skalskip92)。
DeepSeek V4 Pro正式版以低价冲击市场:DeepSeek V4 Pro正式版的推出立即引起了关注,与其说是"每个指标的最佳基准",不如说是经济性。
多位观察者强调定价约为每百万输入token 0.435美元,每百万输出token 0.87美元(kimmonismus),Cline称其比Fable 5便宜约57倍,同时报告比预览版有显著改进,包括Terminal Bench提升15.8%。
能力方面反应不一:一些早期用户发现它很扎实,但在所有任务上并不明显领先于Kimi/Flash(Yuchen Jin的综述、scaling01、teortaxesTex),这表明DeepSeek的下一步进展可能更多取决于RL环境和智能体工作,而不是原始规模。
微软推出自己的推理模型:Mustafa Suleyman宣布了MAI-Thinking-1,这是微软第一个"从头开始构建"的推理模型,现已在Foundry中提供。
团队最初的要求非常务实——Finbarr Timbers特别要求对工具使用提供反馈——这表明微软将其定位为应用推理模型,而不仅仅是基准测试的参与者。
Solar Pro 4也上升了一个层级:Artificial Analysis报告称,Upstage的Solar Pro 4在智能指数上从14跃升至42,在智能体和长上下文任务上尤其有大幅提升,尽管在原始分数和价格上仍落后于当前顶级前沿和开放领导者。
开放权重多模态和边缘模型:视频、视觉、语音和本地推理LTX-2.5和开放视频栈持续改进:@RisingSayak强调Lightricks的LTX-2.5已集成到Diffusers中,具有几个对本地工作流很重要的实用功能:联合视频+48 kHz音频生成、
提示词控制的片段长度、2遍质量模式、用于降低内存使用的平铺渲染,以及重新压缩输入图像以更好地匹配训练的预处理。Ostris AI Toolkit当天也添加了支持。
更广泛地说,多个账号将本周描述为开放多媒体发布的异常强劲一周,包括MiniMax H3、LTX-2.5、LFM2.5-VL-3B和North Micro Vision(victormustar、multimodalart)。
小型VLM和本地多模态正在变得严肃:Cohere发布了North Micro Vision,一个Apache-2.0开源小型VLM,旨在文档理解,声称在广泛的视觉基准组合上优于Gemma 4 E2B和Ministral 3 3B(结果线程)。
Liquid AI的LFM2.5-VL-3B也被多次引用为强大的紧凑视觉模型,用户展示了混合本地/远程智能体栈——例如,Hermes Agent使用DeepSeek V4 Flash进行规划,加上LFM2.5-VL-3B进行本地视觉。
语音和手语发布异常实质性:Google DeepMind宣布了SL2T,一个手语转文本系统,为Android/Pixel 11上的ASL输入提供支持。
后续说明在技术上很有趣:身体姿势跟踪在设备上进行,翻译在服务器端运行,系统针对单手签名等现实世界约束进行了优化(详情)。另外,Deepgram推出了Flux TTS,一个低延迟对话式TTS模型,声称约80毫秒的响应时间和通话中自适应能力,适用于语音智能体。
推理、压缩和系统:vLLM、量化、CUDA调度和排名基础设施vLLM为大型模型和长提示添加了重要基础设施:vLLM现在支持Azure Blob路径用于模型加载和KV连接器。
Microsoft/NVIDIA的配方在操作上很重要:通过Dynamo ModelExpress实现更快的权重加载(在H100/A100上最高快7.3倍),以及通过LMCache + NIXL实现基于Blob的KV缓存,在长提示工作负载上用重新计算换取获取(后续)。
压缩工作正在延长超大型模型的使用寿命:LLM Compressor v0.13.0添加了REAP专家剪枝,用于MoE模型——在量化前根据校准显著性丢弃整个专家——以及任意的3/5/6/7位量化。
在更极端的方面……