开放模型近况:Kimi K3、Qwen 与中美开源竞速

Interconnects AI5 天前

开放模型正在进入加速期

近期开放模型领域出现了一系列值得关注的变化。围绕 Kimi K3 发布后的讨论,播客嘉宾 Nathan Lambert 与 Florian Brand 对开放模型生态做了一次季度回顾,话题覆盖模型能力、开闭源差距、蒸馏争议、中国模型厂商、美国开放模型生态,以及前沿模型安全等。

他们认为,Kimi K3 的发布让开放模型的进展显得更快。与此同时,Qwen 宣布下一代大模型将采用开放权重,这被视为一个重要变化。讨论中还提到,习近平在 WAIC 相关讲话中表达了对开放与开源作为战略方向的支持,不过该讲话并未给出细节化的实施方案。

开源模型与闭源前沿模型的差距如何衡量?

两位嘉宾首先讨论了一个反复出现的问题:开放模型到底落后闭源前沿模型多少个月?

Florian Brand 认为,给出一个确定的“落后几个月”的数字往往会造成误导。原因在于:

  • 当前有大量不同的基准测试;
  • 不同评测网站和研究者会选择不同指标;
  • 支持开放模型的一方可能拿出某些榜单证明模型已接近前沿;
  • 另一方也可以用另一组基准证明它仍然落后一段时间。

Nathan Lambert 则补充说,有些基准测试确实与真实使用场景相关,尤其是智能体式编程、智能体式计算机使用任务等。但如果市场关注的是 Claude Code、Codex 这类面向软件工程的产品,那么哪怕模型只落后几个月,也可能在商业与体验层面产生明显差异。

Kimi K3 的实际使用体验

Florian Brand 试用了 Kimi K3 的高价计划,提到该计划提供百万级上下文,并且在 API 请求上似乎有更高优先级。他表示,很多用户反馈 API 错误频繁,但自己的使用体验相对稳定。

在能力方面,他认为 Kimi K3 在某些任务上表现突出,尤其是部分研究分析任务。举例来说,他曾让模型分析开放模型相关数据,并要求它做出与既有分析不同的新发现。相比许多模型倾向于重复已有分析路径,Kimi K3 尝试抓取 Reddit 讨论,并发现一些此前未被考虑的子版块。模型还提出,Reddit 上关于某些模型的讨论热度,可能比下载量增长提前一到两个月出现。

在编程方面,Florian Brand 的评价较为谨慎:

  • Kimi K3 写出的代码通常更简单、可读性更好;
  • 但在一些边缘情况处理上不如 Codex;
  • 对于实验运行、监督任务、部分日常工程任务,它已经可用;
  • 如果将 Kimi K3 作为主力工具,工作速度可能会变慢,但并未慢到“不可用”的程度。

他还提到,Kimi K3 的响应时间明显更长,可能与 API 负载较高以及服务器位置有关。

GLM 5.2 仍然有实际价值

讨论中,GLM 5.2 被认为仍在发挥作用。Florian Brand 表示,他会继续使用 GLM,部分原因是内部端点速度很快,曾达到每秒数百 token 的级别。

在他的工作流中,GLM 适合处理足够多、难度适中、需要快速完成的任务。例如清理代码、执行重复性工作等。他认为,GLM 5.2 在不少任务上可达到接近 Claude Sonnet 的实用水平。

一个可能的组合是:

  • Kimi K3 作为主智能体;
  • GLM 作为子智能体,处理更快、更常规的任务。

后训练与微调仍有空间

Nathan Lambert 认为,Kimi K3 这样的模型可能还存在较大后训练空间。开放模型社区和产业界正在积极尝试将这类模型针对特定高价值任务进行微调。

不过 Florian Brand 也提醒,Kimi K3 的规模意味着微调并不容易。他提到,仅加载权重就可能需要非常高规格的硬件节点,因此模型要进入可广泛微调的状态,可能需要更多工程优化和时间。

这也意味着,模型本身发布并不是终点。权重开放、推理服务优化、微调工具链成熟,都会影响它最终能否被更广泛地使用。

中国模型厂商与开放权重趋势

播客中提到的中国模型生态包括 Qwen、DeepSeek、MiniMax、GLM、Kimi 等。讨论者认为,中国开放模型近期表现突出,引发了关于数据、训练环境、实验规模和组织能力的讨论。

Qwen 宣布下一代大模型将开放权重,是其中一个重要信号。与 Kimi K3、GLM 5.2 等模型的表现结合来看,开放权重模型已经不只是“可用替代品”,而是在部分任务中进入了开发者真实工作流。

蒸馏争议与开放闭源关系

本期讨论还涉及蒸馏问题。两位嘉宾提到,关于开放模型是否依赖闭源模型蒸馏、蒸馏是否削弱创新等观点,外界存在大量争议。

他们并未给出简单结论,而是将其放在更大的背景中讨论:开放模型和闭源模型之间的关系不只是技术差距问题,也涉及商业模式、监管、安全、国际竞争和生态建设。

对社区的启发

从这场讨论可以看到,开放模型的评价正在从单一榜单转向更复杂的实际使用维度:

  • 是否能进入日常编程工作流;
  • 是否适合智能体任务;
  • 是否具备足够长上下文;
  • 是否能稳定推理与部署;
  • 是否便于后训练和微调;
  • 是否在特定高价值场景中接近或超过闭源模型。

Kimi K3、GLM 5.2 和 Qwen 的动态说明,开放模型生态仍在快速变化。短期内,闭源前沿模型在部分高端任务上仍有优势;但开放模型通过权重开放、社区微调、推理优化和任务定制,也在形成自己的竞争路径。

评论

请登录后发表观点

暂无数据