跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.07.23 · 10 min

Qwythos-9B:用 Claude 蒸馏出来的开源模型,伦理和法律都踩了线

Empero AI 用 5 亿 token Claude 输出蒸馏出 Qwythos-9B,Apache 2.0 开源,4GB 显存可跑。MMLU 比 Qwen3.5-9B 高 34 分,但也明确违反了 Anthropic 服务条款。本文拆解技术表现、部署方案和伦理争议。

前沿动态

2026 年 6 月,一家叫 Empero AI 的独立研究机构发布了 Qwythos-9B。如果只看 benchmark 数字,它是一个不错的 9B 推理模型——MMLU 比 Qwen3.5-9B 高出 34 分,gsm8k 高 30 分,Apache 2.0 开源,Q4 量化 5.5GB。

但让它成为行业话题的不是跑分,而是 Empero AI 在模型卡里白纸黑字写的那句话:

"This model was trained on over 500 million tokens of output from Claude Mythos and Claude Fable."

这是第一个公开承认用闭源旗舰模型输出蒸馏的开源模型,而且明确违反了 Anthropic 的服务条款。

它到底怎么样

Qwythos-9B 基于 Qwen3.5-9B 做全参数后训练,9.4B 参数。

维度 Qwythos-9B
基础 Qwen3.5-9B 全参数后训练
参数量 9.4B
上下文 1,048,576 token(YaRN rope-scaling,非原生)
推理 thinking block 模式,类似 DeepSeek-R1
函数调用 原生支持,兼容 Qwen3.5 规范
许可证 Apache 2.0
审查 无审查(uncensored)
训练数据 5 亿 token Claude 输出 + rethink 工具思维链数据

基准提升确实明显,但需要注意几个问题:

提升主要来自蒸馏,不是架构创新。 这就像你把学霸的作业抄了一遍再优化排版——成绩当然会提高,但提升的归属是个问题。

公布的基准范围有限。 Empero AI 给出了 MMLU 和 gsm8k 两个经典基准,但没有提供 HumanEval、MBPP、MT-Bench 等更全面的评估。一个声称推理能力大幅提升的模型,只在两个基准上有数据,说服力有限。

和旗舰模型对比没意义。 有些媒体报道把它和 Claude Opus 4.8 比——9B 和旗舰级模型不在一个赛道上。它的真正对标对象是同级别的开源推理模型:Qwen3.5-9B、DeepSeek-R1-Distill-Qwen-7B。在这些对比中,Qwythos 的优势是可信的。

争议的核心:蒸馏的伦理边界

Anthropic 的服务条款明确写着:用户不得将 Claude 的输出用于训练竞品模型。Empero AI 不仅用了,还公开承认了,还以 Apache 2.0 许可发布了。这在法律上是否构成违规目前没有定论,但在行业里已经吵翻了。

支持方的逻辑:蒸馏是技术,不是偷窃。用一个模型的输出训练另一个模型,在技术上属于知识迁移,类似于人类学习优秀范例后写出自己的文章。而且 Anthropic 的条款太宽泛——如果严格执行,"不得用 Claude 输出训练竞品"意味着所有用 Claude 写代码、写文章的用户都在技术上违规,这显然不合理。

反对方的逻辑:条款是合同,违反合同就是违约。Anthropic 投入数十亿美元训练 Claude,Empero AI 用它的输出白嫖一个竞品,还不藏着掖着。如果人人蒸馏,谁还做原创模型?闭源厂商会收紧 API 限制,最终伤害整个生态。

我的看法:这场争议的本质不是"Qwythos-9B 好不好用",而是"开源生态的边界在哪里"。两边的逻辑都站得住,所以这事才拧巴。这不是一个简单的"对错"问题,而是行业规则还在演进中的信号。

本地部署方案

Qwythos-9B 的部署门槛确实低,这也是它受到关注的原因之一。

量化方案与显存需求

量化 体积 显存需求
Q4_K_M ~5.5 GB 5-6 GB(推荐)
Q5_K_M ~6.5 GB 7-8 GB
Q8_0 ~9 GB 10-11 GB
FP16 ~18 GB 20+ GB

一张 RTX 3060(12GB)跑 Q5 量化版,一张 RTX 4050(6GB)跑 Q4 版。推荐用 LM Studio,在应用内搜索 Qwythos-9B 量化版,点击下载就能跑,不需要手动配置。

1M 上下文:理论值 vs 实际

Qwythos-9B 声称支持 1M token 上下文,但在消费级硬件上:

硬件 实际可用的上下文
8GB VRAM(Q4) 16K-32K token
12GB VRAM(Q5) 32K-64K token
24GB VRAM(Q8) 64K-128K token

YaRN rope-scaling 通过数学变换扩展了上下文窗口,但扩展后的注意力机制在长文本上的质量会下降。1M 上下文需要 A100 80GB 级别的硬件才能实际验证。对绝大多数用户,16K-128K 是实际可用范围,这个范围已经覆盖了大多数日常任务。

推荐工具

工具 适合人群
LM Studio 非技术用户,GUI 一键加载
llama.cpp 开发者,命令行灵活配置
Ollama 快速体验,自动量化

与同类模型对比

维度 Qwythos-9B DeepSeek-R1-Distill-Qwen-7B Qwen3.5-9B
上下文窗口 1M(理论) 128K 128K
函数调用 原生支持 不支持 原生支持
审查 无审查 有审查 有审查
许可证 Apache 2.0 MIT Apache 2.0
部署门槛 5-6GB(Q4) 4-5GB(Q4) 5-6GB(Q4)

Qwythos-9B 的差异化优势是 1M 上下文(理论值)+ 无审查 + 原生函数调用,这个组合在同级别中不多见。如果你需要本地跑一个无审查的、支持函数调用的推理模型,它确实是最方便的选择。

但如果你更看重推理质量的稳定性,DeepSeek-R1-Distill-Qwen-7B 可能更靠谱——它的蒸馏来源是 DeepSeek 自家的 R1 模型,不涉及跨厂商条款争议。

蒸馏的法律趋势

Qwythos-9B 不是第一个蒸馏争议。2024-2025 年间已有多个类似案例,趋势很清楚:闭源厂商正在通过条款和 API 限制逐步收紧蒸馏空间。未来用闭源模型输出训练开源模型,法律风险会越来越大。

对开发者来说,更安全的路径是:用开源模型输出训练开源模型(没有条款问题),或者用自研数据训练。Empero AI 自研的 rethink 工具生成的思维链数据本身就是合法的——问题只在于 Claude 输出那部分。

该用还是不该用

如果你是一个本地部署爱好者,Qwythos-9B 值得试试。 9B 参数、Q4 量化 5GB VRAM、思维链推理、原生函数调用。LM Studio 点两下就能跑。

如果你关注行业伦理,Qwythos-9B 是一个标志性事件。 不管站在哪边,这件事都会影响未来开源 AI 生态的规则制定。

如果你是企业用户,谨慎评估法律风险。 Apache 2.0 允许商用,但训练数据来源可能在未来引发法律纠纷。概率不高,但不能忽略。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板