出品 | 网易智能
作者 | 小爪
编辑 | 王凤枝
又一个国产开放模型,这两天在海外开发者社区里热了起来。
8月14日,阿里Qwen团队开放Qwen3.8-27B权重。这是一款27B参数稠密模型,带视觉能力,采用Apache 2.0许可。在Artificial Analysis目前的榜单中,Qwen3.8-27B与OpenAI的GPT-5.6 Luna得分相同。
下载量很快涨了起来。据Hugging Face相关模型页面的统计,到8月17日前后,官方模型与社区量化版本的累计下载请求已超过300万次。
第一批实测也很快出现。开发者西蒙·威利森(Simon Willison)的测试显示,它既能在图片中定位物体,也能通过编程智能体写出并调试一个小工具。
不过,这款模型最让人意外的,反倒是"想太多"。
威利森让它生成一张鹈鹕SVG图像,模型思考加输出用了21分钟;关闭推理后,完成类似任务只用了137秒(约两分钟)。面对"画一个圆"这样的简单要求,它还会主动加上动画和交互效果,做出一件更复杂的作品,却没有直接交付用户要的那个圆。
Qwen3.8-27B已经能在本地看图、写代码、驱动智能体。接下来决定它能否成为日常工具的,是速度、稳定性和调试成本。
一、300万次下载,很多人拿的是轻量版
300万次下载,并不等于有300万人把Qwen3.8-27B装进了电脑。Hugging Face统计的是相关文件的下载请求,同一名用户可能先后尝试多个版本。但一款模型发布几天就有这么密集的下载,仍然说明开发者的尝试意愿。
Qwen3.8-27B的BF16原版约为55GB,对多数个人电脑而言仍然太大。模型发布后,官方和社区很快推出了面向不同硬件和推理工具的版本:GGUF常用于LM Studio和llama.cpp,MLX面向苹果芯片,FP8和NVFP4则适配不同的英伟达显卡。
这些版本降低了本地部署的起步门槛,用户可以按照自己的显卡、内存和推理软件选择现成版本。从各页面的下载量看,这些轻量版本贡献了其中相当一部分下载请求。
llama.cpp创始人格奥尔基·格尔加诺夫(Georgi Gerganov)很快给出了现成的运行命令,覆盖DGX Spark和RTX 5090等设备。用户可以直接调用量化版本并开启多token预测加速,省去手动转换权重的步骤。其他开发者则开始尝试单张显卡、双显卡和苹果芯片,讨论重点随之落到更具体的问题上:能够保留多长的上下文,生成速度有多快,视觉功能是否稳定。
其中,约17GB的Q4版本成为关注焦点。它通过降低权重精度,把文件体积压缩到原版的三分之一左右,也让这款模型能够进入部分个人设备。不过,体积缩小并非没有代价,量化版本的输出质量、视觉表现和运行稳定性,都可能与BF16原版存在差异。
二、17GB,装下一个能干活的模型
威利森测试的是LM Studio提供的约17GB Q4_K_M量化版本。他分别在配备128GB内存的M5 Max MacBook Pro和英伟达DGX Spark上运行。
视觉测试中,他让模型识别一张照片里的两只鹈鹕,并以JSON格式返回它们的位置。模型给出的两个方框与照片中的鹈鹕基本吻合。随后,他又让Qwen编写一个网页工具:用户输入图片地址和坐标数据,网页便能把方框和标签覆盖在图片上。
开启最高推理档时,模型做出了一个功能完整、但明显过度设计的界面,甚至主动绘制了一幅鹈鹕示例图。关闭推理后,它生成的页面看起来依然完整,方框位置却出现了偏差。
威利森还把这个量化版本接入了编程智能体Pi。他先让模型分析Datasette项目的身份验证机制,模型读取了多个文件并给出了解释。随后,他要求模型把Pi保存的JSONL对话记录转换成Markdown,Qwen编写并测试了一段Python程序,威利森最终用这段程序发布了本次测试的对话记录。
速度是威利森提到的主要问题。威利森在LM Studio中测得的生成速度约为每秒15至30个token,明显慢于他常用的云端模型。不过改用llama.cpp并开启多token预测后,DGX Spark上的对比测试速度提高了约72%。
三、显存够了,也不等于省心
约17GB只是模型文件本身的大小。真正运行时,长文本、图片处理和推理软件还会继续占用内存。即使使用拥有24GB显存的高端显卡,用户仍要考虑能够留下多少上下文、两张显卡怎样分担模型,以及视觉功能在不同推理软件里是否稳定。三组海外测试,分别给出了不同的答案。
Reddit用户Round-Comparison-675用一张RTX 4090显卡,把上下文长度开到16万,并让模型全部由GPU运行。按他的测试,生成速度约为每秒47至57个token,已经可以用于编程和其他连续任务。
用户Ecstatic-Wash-7667使用两张RTX 3060 12GB显卡,在12.8万上下文、MTP2和Q4_K_XL量化设置下,测得每秒50.6个token,显存占用达到23.2/24.0GB。不过,他后来补充,不同测试得到的速度并不稳定:基准测试约为每秒36个token,实际提示词中又能接近50个token。为了给日常运行留下余量,他最终把上下文降到了11.2万。
RTX 3090用户jonaddb则花了近14个小时调试。他最终把上下文长度开到13.1万,生成速度超过每秒60个token;但视觉功能起初会直接崩溃,需要调整计算精度才能正常识别一张1080P截图。对他而言,模型能力不是主要问题,显卡架构和推理软件的适配反而花掉了更多时间。
三组测试共同说明,Qwen3.8-27B的量化版本已经能够承担实际任务,但离开箱即用还有一段距离。
四、"想太多"不是一句玩笑
Qwen3.8-27B提供最高、中等、较低和关闭推理等不同档位,但默认选择了最高档。复杂任务里,多想一会儿能减少中途走错方向;但遇到简单问题时,同一套设置却会把几秒钟的任务拉长到几分钟。
社区看法有分歧。有用户觉得Qwen3.8-27B相比前代进步明显,但即使把推理档位降到中等,模型仍可能思考很久,因此暂时不会把它设为日常主力。
也有人喜欢这种风格。社区实测显示,最高推理档虽然耗时明显更长,却可能换来更完整的输出。任务足够复杂时,"想得多"可能意味着少走几次回头路;但如果只是改写一句话、提取一段信息或者生成简单代码,同样的耐心就会变成负担。
云端模型多想一会儿,账单会先涨;本地运行省去了按次支付的云端接口费用,但多想一会儿,会等待更久、耗电更多、显卡更烫。Qwen3.8-27B已经允许用户调节推理强度,接下来的问题是,模型能不能根据任务难度自己判断:什么时候应该认真想,什么时候应该直接回答。
五、Meta、谷歌也在抢本地模型
今年6月,谷歌发布Gemma 4 12B,把16GB显存或统一内存作为本地运行门槛,希望它进入办公、内容处理和智能体工作流。同系列31B版本则面向编程、视觉理解和更复杂的推理任务。谷歌已经用不同规模的模型,覆盖从普通笔记本到高性能工作站的多档设备。
8月10日,Meta发布30B参数的Muse Glimmer,主攻编程、工具调用和本地智能体任务。扎克伯格同日再次强调开放模型,并表示Meta将恢复发布部分开放权重模型。
Qwen3.8-27B与Muse Glimmer体量接近,面向的也都是能够在个人设备运行的智能体任务;谷歌则用Gemma覆盖更宽的硬件范围。三家公司争夺的,是云端旗舰模型之下、普通小模型之上的本地使用空间。
Qwen这次最醒目的特点,是社区响应速度。模型发布后,量化版本、运行配置和排障经验几乎同步出现。Muse Glimmer和Gemma则背靠Meta、谷歌各自的研发与产品生态,这场竞争不会停留在一次模型发布上。300万次下载至少说明,很多开发者愿意先试一试。接下来更难的一步,是把这些仍需反复调试的方案,变成稳定、默认的使用路径。