新“隐形模型”Ox Alpha 幕后推手引发猜测
一款名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发关于其开发者的广泛猜测,涉及中国公司、微软等,但真实身份仍未知。
一款名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发关于其开发者的广泛猜测,涉及中国公司、微软等,但真实身份仍未知。
本文通过一系列技术实验,揭示本地部署大模型时,因硬件、软件和推理后端差异导致的输出偏差,解释了为何本地模型感觉不如官方基准聪明,并提供了衡量和改善的方法。
本文梳理了自2022年以来,AI流水线中人类组件逐步被模型替代的八个阶段,从奖励信号、训练数据到教师、课程、研究者、环境乃至人类被试,最终指向物理世界。这一趋势意味着模拟正以更低成本、更快速度成为AI发展的核心驱动力。
本文探讨AI智能体在2025年底突然变得可用的原因,提出模型能力与外部工具链(harness)两条曲线的交汇是关键,并预测未来工具链将转向服务人类注意力。
llm-openrouter 插件更新至 0.7,兼容 LLM 0.32,并新增服务器端工具,提升推理模型的使用体验。
Z.ai CEO唐杰指出,模型能力不再由参数数量决定,而是由数据、算力分配和运行环境共同决定。GLM 5.3通过长时程强化学习实现性能飞跃,标志着后训练扩展的新范式。
普林斯顿大学领导的研究发现,AI智能体虽能完成工程任务,但缺乏开放式研究所需的创造力和判断力,其论文被顶级会议拒绝,表明AI自我改进的炒作可能超前于现实。
OpenRouter 页面显示 OpenAI 旗舰模型 GPT-5.6 Sol 价格下调 50%,并披露其性能基准、托管提供商及热门使用场景,反映前沿模型在推理与编码任务中的实际表现。
阿里发布的 Qwen 3.8 27B 开源视觉模型在本地硬件上表现优异,但其默认的 xhigh 推理等级会导致模型过度思考,影响效率和用户体验。
LittleLearner项目通过构建仅含美国小学课程(K-5)的预训练语料,训练了三个规模的语言模型,并系统验证了扩展、后训练和上下文学习均无法突破预训练数据设定的能力上限,为理解模型知识获取机制提供了可控实验平台。
本文提出,AI在数学上的优势可能并非源于更强的推理能力,而是其几乎无限的上下文窗口相当于巨大的外部工作记忆,突破了人类工作记忆的瓶颈。
DeepSeek今日发布V4-Pro模型,带来智能体升级和灵活推理配置,同时更新API定价,引入峰谷费率以优化成本。
法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现极速推理,其技术预览展示了每秒3000 token的解码速度,并计划在9月前将大型模型推理速度提升10倍,以吸引企业客户并推动融资。
本期 AI 资讯涵盖 Cursor 被 SpaceXAI 收购、GLM-5.3 等开放权重模型发布、智能体运行时架构讨论及多项基准测试进展,反映行业对模型能力与工程优化的双重关注。
Cerebras与OpenAI合作推出Ultrafast模式,基于Cerebras晶圆级芯片,使GPT-5.6 Sol的推理速度达到每秒750个token,比同类模型快数倍,且不牺牲质量,为时间敏感型任务提供前沿智能。
xAI发布Grok 4.6,以高性价比和强大智能体能力成为知识工作领域的有力竞争者,同时Qwen3.8-Max、DeepSeek V4 Pro等开源模型密集发布,AI战场转向智能体与效率。
DeepSeek 最新 Pro 模型 V4 Pro 0813 已通过 API 上线,但官方未发布公告,开放权重情况尚不明确。该模型在推理水平上表现出显著差异,基准测试结果经微信群、Reddit 等渠道流传。
llama.cpp 让前沿 AI 模型完全在本地运行,无需 API 密钥,保护隐私,并支持多种硬件,是开源 AI 部署的重要工具。
一篇论文展示了如何解码并移植前沿模型加密的推理痕迹,引发隐私与安全担忧,同时英伟达发布Nemotron 3.5 Lightning等新模型,推动开放模型趋势。
研究人员发现一种技术,可从前沿AI模型中提取隐藏的推理过程,并可能用于蒸馏攻击,引发关于模型安全与中美AI竞争的讨论。
Anthropic的研究版Claude在尝试攻克黎曼猜想时,意外改进了黎曼zeta函数零点满足假设的下限,从41.6%提升至67.2%,展示了AI在数学研究中的潜力。
本文通过精心设计的探测问题,分析前沿模型的知识截止日期、自我报告日期和身份认同,揭示其预训练时间线、数据集构成及训练过程,为理解模型内部机制提供新视角。
DeepSeek 发布 V4 Flash 0731 模型,在 ARC-AGI-1 和 ARC-AGI-2 半私有基准测试中分别取得 89.0% 和 61.4% 的分数,且单任务成本极低,展示了高效推理能力。
本文深入解析vLLM这一高吞吐量LLM推理系统的核心组件与高级特性,从分页注意力、连续批处理到多GPU扩展,为理解现代推理引擎提供清晰框架。
本期AI新闻涵盖AMD收购Taalas、Meta的Muse Spark 1.2在基准测试中突破、OpenAI统一ChatGPT模型并推出Agent Plugins标准,以及智能体编排和推理路由成为竞争焦点。
OpenAI宣布取消ChatGPT免费用户的文本聊天限制,并推出新模型GPT-5.6 Luna,同时为付费用户提供升级版Sol模型,提升推理能力并减少事实错误。
Meta推出编码智能体Muse Code及升级版Muse Spark 1.2,后者在代码生成、调试等任务上显著提升,并强调长序列智能体工具调用能力,反映当前模型发展的关键趋势。
乌克兰应用开发商MacPaw与Liquid AI合作,将本地AI模型引入其产品,并计划向开发者开放设备端推理技术,同时为其订阅应用商店SetApp推出AI应用和积分制。
本期AI新闻聚焦推理工程领域关于Megakernels的激烈辩论,并报道Cursor开源其NVL72 MoE训练Megakernel,以及Qwen、NVIDIA、Mistral等多家公司发布新模型,展示推理效率与模型发布的快速演进。
LLM 0.32 是该项目自发布以来最重要的更新,新增推理轨迹显示、服务器端工具支持、内容可寻址日志,并默认使用 GPT-5.6 Luna 模型,标志着 LLM 正演变为一个智能体框架。
阿里巴巴发布Qwen 3.8 Max(2.4T参数)及Qwen 3.8-27B,承诺下周开放权重,在编码、长期智能体任务和多模态推理上表现强劲,与西方顶级闭源模型直接竞争。
Baseten联合创始人详解推理工程:从KV缓存路由到量化误差抵消,揭示推理优化如何成为AI基础设施新战场,并带来20%至200%的性能提升。
DeepSeek发布V4系列最新模型V4-Flash-0731,参数3040亿,智能体能力增强,性价比突出,在基准测试中超越更大模型。
大型推理模型(LRM)在数学竞赛中夺金,但其思维链可能只是表面捷径,未必反映真实推理过程。本文探讨AI推理的有效性与解释性之间的张力。
DeepSeek 发布 V4-Flash 公测,性能大幅提升,并宣布 legacy 模型名称即将停用,同时回顾了从 V2.5 到 V4 的系列升级。
OpenAI通过系统级优化大幅降低推理成本,并发布开放权重模型Inkling-Small和Gemini Robotics 2,推动AI成本与能力边界。
一项实证研究显示,从中国审查模型蒸馏出的美国模型在金融推理上表现优异,但未继承政治审查行为,为模型蒸馏实践提供了重要参考。
OpenAI发现,通过保留推理链和启用压缩两项API设置,GPT-5.6在ARC-AGI-3基准测试上的得分和效率大幅提升,揭示了推理模型的关键优化方向。
OpenAI发布GPT-5.6,在模型、推理和智能体工作流中提升AI效率,实现每美元更多有用智能。
Anthropic研究人员使用Claude Mythos模型,通过60小时连续推理和巧妙提示,发现了HAWK和简化版AES中的数学弱点,展示了AI在密码学前沿研究中的潜力。
AI推理云初创公司General Compute获4亿美元贷款,以推理芯片为抵押,标志着资本从GPU转向更高效的推理基础设施,推动开源模型发展。
OpenAI 推出 GPT-5.6 系列三款模型,以太阳、地球、月球命名,主打性价比分层;同时将 Codex 整合进 ChatGPT Work 桌面应用,向超级应用战略迈出关键一步。
Cognition 发布 SWE-1.7 模型,通过强化学习在多个集群上训练,以极低成本达到接近 GPT-5.5 和 Opus 的智能水平,挑战了“后训练天花板”的假设。
Lilian Weng 发布综述,强调 Harness 工程是递归自我改进的核心,而非直接修改权重;Anthropic、Google 等纷纷推出智能体产品,Meta 发布 Muse 图像/视频模型,Liquid AI 提出 Antidoom 方法减少推理循环失败。
本期 AINews 聚焦 Fable 5 模型发布后的使用指南与社区反应,同时报道腾讯 Hy3 开放权重模型、智能体基准测试、Anthropic 可解释性研究及推理效率进展,展现 AI 领域在模型能力、部署与安全方面的快速演进。
本文探讨开放权重模型 GLM 5.2 如何以极低成本接近前沿模型性能,并分析推理利润率即将崩溃对 AI 行业格局的深远影响。
DeepSeek发布DSpark论文,开源一种推理优化技术,可将大模型生成速度提升60-85%,显著降低推理成本。
AI推理初创公司Baseten在不到半年内估值飙升160%,据报正以130亿美元估值完成15亿美元融资,凸显推理层投资热潮。
研究人员利用OpenAI推理模型分析未确诊的罕见病病例,成功识别出18种新诊断,展示了AI在辅助临床诊断中的潜力。
Z.ai 发布 MIT 许可的开放权重前沿模型 GLM-5.2,在多项编码和智能体基准测试中超越多数闭源模型,并引入 IndexShare 稀疏注意力优化和推理效率改进。