AI 见闻
精选· 重要性 4/5

Qwen-Image-3.0-Pro:支持复杂布局与精细细节的图像生成模型

Hacker News (AI)··theanonymousone·约 3 分钟阅读
社区热度 191
中文导读

Qwen-Image-3.0-Pro是阿里云推出的新一代图像生成模型,支持复杂布局、精细文本渲染和多语言能力,旨在将图像生成从“好看”推向“实用”,成为可部署的生产力工具。

Qwen-Image-3.0-Pro概述内容丰富:支持最多4.5k token的输入和密集信息布局,包括图像中的图像,能够一次生成报纸、故事板、菜单和试卷等复杂布局。真实细节:支持小至10px文本的精确渲染,并生动再现微表情、毛孔和单根发丝等细微细节,接近真实摄影的质量。

深度知识:支持12种语言和20多种字体的原生渲染,真实模拟网页、游戏、直播等主流界面,并充分融入外部知识。Qwen-Image-3.0-Pro不仅追求“好看”,更追求“有用”,使图像生成成为真正可部署的生产力工具。

输入输出特性前缀补全调用Qwen API时启用Partial Mode,使模型严格从您提供的前缀文本继续生成。查看文档函数调用使用函数调用将大语言模型与外部工具和系统连接。查看文档缓存上下文缓存为长上下文请求存储共享前缀,以减少重复计算、改善延迟并降低成本。

查看文档结构化输出结构化输出有助于确保模型以预期格式返回JSON字符串。查看文档定价- 1K图像输入$0.003每张图片- 2K图像输入$0.003每张图片- 1K图像输出$0.04每张图片- 2K图像输出$0.075每张图片

速率限制- RPM每分钟请求数1API参考调用APIcurl --location 'https:

//dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \--header 'Content-Type:

application/json' \--header "Authorization:Bearer $DASHSCOPE_API_KEY" \--data '{"model":"qwen-image-3.0-pro","input":{"messages":

[{"role":"user","content":[{"text":"一张垂直的户外肖像照片,营造出温暖、胶片般的下午街头氛围,一位美丽的年轻成年女性回头看向镜头,露出灿烂的笑容,她浓密的长卷黑发捕捉到金色的轮廓光,白皙的皮肤、精致的眉毛、明亮的眼睛和柔和的珊瑚红嘴唇,

展现出容光焕发的表情。她穿着一件简单的黑色露背连衣裙,带有细肩带,露出背部,怀里抱着一大束茂盛的橙色、杏色、粉色和淡桃色玫瑰,与她的连衣裙形成鲜明对比。

画面左上角覆盖着深绿色的藤蔓和自然垂下的橙色小花,部分遮住了一块哑光深蓝色招牌,上面有白色哥特式文字“Il Messaggero”。招牌下方是一扇模糊的玻璃报亭窗户,黑色金属框内隐约可见报纸和杂志。

右侧背景是强烈的黄金时刻背光,洒在温暖色调、阳光普照的城市街道上,建筑物模糊成柔和的米灰色形状,形成美丽的散景效果,远处有一个模糊的红色交通标志。整个图像具有电影感、浪漫、明亮的城市漫步氛围,特点是柔和的对比度、细腻的胶片颗粒、浅景深和令人惊叹的逆光高光。

"}]}]},"parameters": {"prompt_extend": true}}'

原文出处
Qwen 3.0 Image Pro

本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。

相关阅读