DeepSeek 视觉模型 API 文档:支持图像输入与多方式上传
DeepSeek 发布 deepseek-v4-flash-vision-exp 视觉模型,支持图像与文本混合输入,提供多种图像上传方式,并兼容 OpenAI 与 Anthropic API,便于开发者集成多模态能力。
DeepSeek 发布 deepseek-v4-flash-vision-exp 视觉模型,支持图像与文本混合输入,提供多种图像上传方式,并兼容 OpenAI 与 Anthropic API,便于开发者集成多模态能力。
谷歌在搜索和Gemini中推出AI学习工具,包括交互式可视化、3D模拟和定制测验,旨在与OpenAI等竞争,提升学生学习体验。
苹果据报将推出带摄像头的AirPods,但摄像头仅用于Siri视觉识别,不录制媒体,旨在减少屏幕依赖,但LED指示灯可能引发隐私担忧。
一段在macOS测试版中发现的视频展示了苹果传闻中带摄像头的AirPods,该设备旨在为Siri等AI功能提供视觉信息,可能于9月与新版Siri一同发布。
Roboflow对OpenAI新发布的GPT-5.6系列进行视觉基准测试,结果显示Sol在检测和计数上大幅进步,但成本与延迟仍存短板。
Suno推出Studio 2.0,新增MIDI支持、效果插件和聊天机器人,使其从简单的AI音频编辑器升级为更接近专业数字音频工作站(DAW)的工具,标志着AI音乐生成向专业制作领域深入。
谷歌在Made by Google 2026活动上发布Pixel 11系列、Pixel Watch 5和Pixel Tag追踪器,并推出多项Gemini驱动的AI功能,包括手语翻译和更自然的语音输入。
谷歌DeepMind推出手语转文本模型SL2T,为聋人和重听用户提供新的手语功能,推动无障碍技术发展。
谷歌发布Pixel 11系列手机,带来多项由AI驱动的相机新功能,包括Magic Capture自动拍摄、Instant Night Sight快速夜景和Camera Looks个性化外观,旨在提升拍摄体验并吸引更多用户。
llama.cpp 让前沿 AI 模型完全在本地运行,无需 API 密钥,保护隐私,并支持多种硬件,是开源 AI 部署的重要工具。
Meta发布开放权重模型Muse Glimmer,并预告Spark,重申个人超级智能愿景,强调本地部署与个人赋能,引发行业关注。
这是一款语音驱动的谋杀悬疑游戏,玩家可通过语音与AI嫌疑人对话,解开谜团。该游戏展示了语音交互在游戏领域的应用潜力。
Qwen-Image-3.0-Pro是阿里云推出的新一代图像生成模型,支持复杂布局、精细文本渲染和多语言能力,旨在将图像生成从“好看”推向“实用”,成为可部署的生产力工具。
Wrinkles是一款利用定位技术自动讲述周边地点故事的AI音频导游应用,覆盖全球177个国家,旨在让用户在行走中了解历史与当地传说,同时支持用户共创内容与社交分享。
MiniMax 发布通用多模态生成系统 MiniMax-H3,社区将其移植到 MLX 以在 Apple Silicon 上运行,可生成带音频的 15 秒视频。
阿里巴巴发布Qwen 3.8 Max(2.4T参数)及Qwen 3.8-27B,承诺下周开放权重,在编码、长期智能体任务和多模态推理上表现强劲,与西方顶级闭源模型直接竞争。
谷歌在Google Earth中推出基于Nano Banana 2的AI图像生成功能,因被批评可能被滥用传播错误信息,上线一天后即被撤回。
谷歌地球新推出的AI图像编辑功能因被滥用生成虚假内容,上线仅一天即被关闭,凸显了AI生成工具在真实世界图像上的风险。
谷歌地球新增AI图像生成功能,可基于卫星图像创建逼真场景,但专家指出该工具易被滥用,可能传播错误信息。
谷歌推出Gemini Robotics 2.0,包含三款模型,旨在提升机器人操作的灵巧性和安全性,目前仅一款开放。
谷歌DeepMind发布Gemini Robotics 2,将视觉语言模型与动作模型结合,使机器人能自主执行复杂任务,标志着AI从数字走向物理世界的重要一步,但安全风险也随之凸显。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,通过实时视频理解、任务进度追踪和多机器人协作,显著提升机器人在物理世界中的自主性与安全性。
黑森林实验室推出FLUX 3,一个统一的多模态模型,涵盖图像、视频、音频和动作预测,在多项基准上超越竞争对手,并展示了向机器人领域迁移的能力。
Runway通过Runway Dev平台推出Media Router,自动为图像、视频和音频生成任务选择最佳模型,旨在成为生成媒体基础设施层,应对模型数量激增和开发者选择困难的问题。
谷歌推出三款新模型:3.6 Flash提升编码与多模态性能并降低token消耗,3.5 Flash-Lite主打高速低成本,3.5 Flash Cyber专攻网络安全漏洞检测与修复,同时透露Gemini 4预训练已启动。
Adobe的Project Indigo相机应用从追求自然单反效果转向集成生成式AI编辑工具,包括滤镜、物体移除和聊天反馈,标志着移动摄影与AI的深度融合。
Google 为 Vids 引入 Gemini Omni 多模态模型,支持基于自拍和录音创建个性化数字分身,并实现逐步编辑,使该工具从 AI 辅助演示工具升级为一体化视频创作平台。
Thinking Machines Lab 发布了其首个开放权重模型 Inkling,这是一个 975B 总参数、41B 活跃参数的混合专家 Transformer,在 45 万亿 token 的多模态数据上训练,采用 Apache-2.0 许可,旨在作为可微调的强大基础模型。
Apple Intelligence获中国网信办批准,将整合阿里巴巴Qwen模型和百度AI,为iPhone等设备提供生成式AI功能,标志着苹果在关键市场迈出重要一步。
Thinking Machines Lab发布其首个完全开放权重的多模态基础模型Inkling(975B总参数/41B激活),采用MoE架构,支持文本、图像、音频输入及1M上下文窗口,成为美国最强的Apache 2.0开源模型,但部分基准仍落后于中国顶尖开源模型。
Thinking Machines发布Inkling,一个975B总参数(41B活跃)的开放权重混合专家模型,支持文本、图像和音频输入,并可在Tinker平台上微调。
研究人员开发出 EgoBabyVLM 测试,发现当前最先进的 AI 模型在理解婴儿视角的世界时表现糟糕,这提示婴儿大脑的高效学习机制可能为构建更节能、更自然的 AI 提供关键启示。
为庆祝成立 25 周年,Google Images 首页将改为动态推荐画廊,同时 Google 搜索的 AI 概览功能将能使用 Nano Banana 2 Lite 模型生成图像,但触发条件和风险控制细节尚待披露。
Google Images 迎来重大改版,采用类似 Pinterest 的浏览式画廊设计,并新增搜索内 AI 图像生成功能,旨在将图片搜索转变为发现与灵感平台,提升用户停留时间和广告收入。
Ghost Font是一种利用运动、噪声和诱饵消息的字体,人类能轻松阅读,但前沿AI模型难以解码,探索了AI视觉感知的极限。
Meta 推出专为智能体编码设计的多模态 AI 模型 Muse Spark 1.1,以低价策略挑战 OpenAI 和 Anthropic,CEO 扎克伯格为此三年来首次在 X 平台发帖。
Meta推出Muse Spark 1.1模型,通过新Meta Model API向开发者开放,具备高级编码、多智能体工作流和多模态感知能力,旨在缩小与OpenAI等对手的差距。
Character.AI推出c.ai Series,这是一系列由生成式AI制作的动画微短剧,用户可在观看后与角色聊天。此举旨在拓展其作为娱乐平台的定位,并抢占预计达260亿美元的微短剧市场。
Google Photos 新增“Video Remix”功能,利用 Gemini Omni 模型实现快速视频编辑与风格转换,进一步将生成式 AI 融入消费应用,以增强生态粘性。
OpenAI发布GPT-Live-1语音模型,实现全双工对话,能同时听说并减少打断,支持实时翻译和AI可视化,提升交互自然度。
OpenAI 推出全双工语音模型 GPT-Live-1 和 GPT-Live-1 mini,支持同时听说、自然打断和实时翻译,旨在让语音成为复杂工作的主要计算界面。
OpenAI推出GPT-Live语音模型,旨在实现更自然的人机语音交互,并已集成至ChatGPT Voice功能中。
Meta发布由Meta超级智能实验室开发的新AI图像生成器Muse,免费提供于Meta AI应用、Instagram Stories和WhatsApp,支持自定义广告、室内设计等创意功能,并计划推出视频生成器Muse Video。
Meta 发布由超级智能实验室打造的首个 AI 图像生成模型 Muse Image,支持在提示词中 @ 提及其他 Instagram 账户以使用其形象,并计划推出 Muse Video 模型。
Google 推出 Nano Banana 2 Lite(即 Gemini 3.1 Flash Lite Image),号称最快最便宜的 Gemini 图像模型,专为速度和规模优化。
Google的NotebookLM推出新功能,可根据用户上传的资料生成60秒竖屏AI视频摘要,以TikTok风格呈现研究内容,目前面向AI Ultra和Pro订阅者开放。
谷歌推出Nano Banana 2 Lite,速度更快、成本更低,每千张图像仅需0.034美元,旨在满足大规模快速图像生成需求,同时宣布与A24的7500万美元合作及Gemini Omni Flash的广泛发布。
Proton将其隐私优先的AI聊天机器人Lumo升级至2.0版本,新增图像识别与生成、持久记忆及思维模式,响应速度提升76%,在保护用户隐私的同时增强AI能力。
谷歌宣布Gemini应用的个性化AI图像生成功能向所有符合条件的美国用户免费开放,该功能基于用户Google账户数据生成反映个人兴趣的图像,此前仅限付费订阅者使用。
Adobe 为 Firefly AI 助手推出重新设计的界面,新增“元素”和“项目”功能,支持跨项目复用资产、保持设计一致性,并扩展视频编辑能力,旨在让 AI 成为创意工作的协作伙伴而非替代工具。