Qwen 3.8 27B 表现出色,但默认推理设置导致过度思考
阿里发布的 Qwen 3.8 27B 开源视觉模型在本地硬件上表现优异,但其默认的 xhigh 推理等级会导致模型过度思考,影响效率和用户体验。
Qwen 3. 8 27 B很棒,但默认为过度思考2026年8月16日周五的重大发布是Qwen 3。8 27 B,来自阿里巴巴Qwen研究实验室的Apach 2许可的27 B参数视觉LLM。
我一直在期待这款产品:27 B是一个绝佳的尺寸,适合在规格合理的笔记本电脑及其前身Qwen 3上运行模型。6 27 B令人印象深刻。Qwen自我报告的该模型基准令人大开眼界。它们显示了Qwen 3的推动力。
6 27 B和封闭重量Qwen 3。7-Plus,就在今年5月,它还是Qwen最强大的任何尺寸型号之一。听听独立基准对该模型的看法将会很有趣。我一直在两台不同的机器上运行该模型:我的128 GB M5 Max MacBook Pro和一台NVIDIA DGX Spark。
我在这两台机器上都运行LM Studio及其17 GB Q4_K_M量化版本。我还尝试使用羊驼服务器直接在火花上。
超高的默认导致惊人的过度思考Qwen的文档将该模型描述为默认xhigh为了进行推理,我一直在尝试的LM Studio GGUF保留了该默认值:Qwen 3. 8有官方支持推理努力,可用于调整推理深度和控制成本:xhigh(默认值):用于需要全面分析的复杂任务medium:
平衡精度和速度:高效推理优化速度和成本这是一个滑稽的默认。
这绝对不是运行该模型的好方法,尤其是在消费者硬件上。我发现结果非常有趣。我很快就遇到了LM Studio默认上下文限制8,192个代币的问题-Qwen甚至在考虑最平凡的问题时都用完了它们。我在模型中加载了完整的262,144最大上下文长度,这个问题就消失了。
这是我第一次尝试时得到的骑自行车的鹈鹕,上下文长度增加了。生成过程耗时21分钟,使用22,276个推理令牌产生3,223个输出令牌。您可以在这里阅读推理痕迹。
这是迄今为止我能够通过在本地机器上运行的模型生成的最好的鹈鹕JPEG-而且这个Qwen非常小,磁盘上只有一个17 GB文件。这个有很多值得喜欢的地方:- 自行车架形状正确- 它的自行车两侧都有腿--这非常罕见- 良好、透明的鹈鹕袋- 翅膀延伸到触摸车把!
- 运动线在后面,而不是前面- 它有着高雅的背景--美丽的阳光、云彩、山丘、花草。这值得等待21分钟吗?绝对不行这是同样的提示,但推理已关闭--这里的文字记录。这一次生产了3,715个代币,花费了137个代币--仅两分钟多一点。
为了完整性,我使用OpenRouter在更大的Qwen 3中运行相同的提示。8 2.
4 T-A95 B(上周发布)并获得了这个时髦的动画VG:我说xHigh的Qwen有想太多的倾向,但实际情况有多糟糕?我尝试了一个简单得多的提示,再次使用默认的超高设置:画一个圆的svg奎文的推理轨迹是这样开始的:用户正在要求绘制圆圈的Stewart绘制。
简单的要求-但我希望它是一件精心制作的作品。让我做一些超越<circle>:一个包含字符的独立的JPEG文件-可能是几何“圆研究”,具有微妙的动画、分层的环和独特的调色板。保持范围正确:他们要求一个圆形的VG。
所以核心是一个圆。但我可以添加工艺:同心引导圆(如指南针/几何图形)、标记、主圆上的软渐变填充、受限制的环境运动(缓慢旋转的虚线环、脉冲辉光)。尊重优先减动?对于CSS来说,这更多;VG SMIL或VG内部的CSS就可以了。
收件箱选项:温暖的纸上涂着深青色墨水?或者在灰白色上画上大胆的朱红色圆圈,带有海军建筑线条-包豪斯/指南针绘制的氛围。让我选择“几何研究”的外观:凉爽的石板背景,还是明亮的纸白色?如果不是奶油和陶土的组合,白纸也可以。
[. . . ]几分钟后,它产生了这个绝对美丽的动画圆圈,这完全不是我想要的!我的强烈建议:忽略该默认值。运行Qwen 3。
8 27 B一开始推理水平较低甚至没有。这是一个很棒的模型,但哇,默认设置是一个糟糕的开始。它非常擅长包围框测试视觉模型的一个有趣方法是看看它返回照片中项目周围的边界框的效果如何。我见过之前的Qwen模型很好地处理了这个问题,所以我决定测试一下,在一些鹈鹕周围绘制边界框。
我过去见过要求0-1000规模会产生很好的结果。我尝试过这个:llm -a https://静态。非自然主义者。org/photos/714731804/large。jpg \-m lmstudio/qwen/qwen 3。
8- 27 b\“返回这张照片中鹈鹕的杨森边界框,每个维度的比例为0-1000”这是推理轨迹,它产生了这样的结果:[{“bbox_2d”:[195,290,370,780],“标签”:“鹈鹕”},{“bbox_2d”:[445,320,675,850],“标签”:
“鹈鹕”}]这真是一场精彩的比赛。以下是照片顶部渲染的那些方框:构建标签边界框的工具边界框的可视化是使用我拥有的Qwen 3的新自定义工具进行的。8 27 B为我构建,在我的笔记本电脑上离线运行。
我忘记了减少思考工作,所以它被严重过度设计,但它确实设法通过这个提示生成了完整的界面:[ {“bbox_2d”:[195,290,370,780],“标签”:“鹈鹕”},{“bbox_2d”:[445,320,675,850],“标签”:
“鹈鹕”} ]构建一个HTML页面,该页面具有一个用于接受图像URL的输入框和一个用于接受上述风格的SON的文本区域。它将图像附加到页面,测量其宽度和高度,然后将bbox_2d中的坐标视为0-1000之间的缩放,并根据实际宽度和高度进行缩放,然后在图像上渲染带标签的框。
此屏幕截图显示了我没有要求的功能之一-演示场景,如果您没有照片来测试该工具:这是思维轨迹的相关部分,它决定绘制自己的鹈鹕,纯粹是因为我在提示中给它的例子中使用了“鹈鹕”标签:还是使用已知图像的“加载示例”?
不能依赖于外部图像,但是.图像URL输入是用户提供的;我可以添加一个“尝试使用示例”按钮[。. . ]嗯,我可以在画布上绘制一个简单的场景,将其输出为数据URL,然后将其加载到图像中-这是自包含且可演示的!
[. . . ]但用户的坐标是针对实际的鹈鹕图像;生成的占位符仍然可以演示缩放。
生成1000 x1000占位符:渐变水+放置在给定的bbox上的两个斑点状“鹈鹕”轮廓(使用相同的比例-可爱:准确的0-1000位置的轮廓,显示框对齐)。这是一个有趣、独立的演示。保持简单:天空梯度、太阳、水、两种鹈鹕形状(椭圆形身体、圆形头、喙)。
放置在bbox中心。(我有点担心,世界各地的模特可能会有一种倾向,只要有机会就画鹈鹕,这是因为我近两年接触了我自己的愚蠢基准。)这些过度思考有必要吗?也许是,至少有一点。
我尝试关闭推理,并得到了这个版本(此处的文字记录),它几乎有效,但将方框显示在错误的地方:因此,如果没有推理,它并不是一次性的工作工具。我相信只要有一些后续提示,它就可以实现,但这是推理如何发挥作用的一个很好的例子。
是的,它可以驱动编码代理围绕本地模型的最大问题之一是它们是否有足够的动力来成功运行编码代理循环。编码代理需要长上下文、强大的代码生成支持和可靠的工具调用
本文为机器翻译辅以 AI 润色,仅供参考。原始事实以原文为准。