Claude Opus 5 发布后引发大量讨论:官方称其接近 Fable,部分独立评测显示其在知识工作与编码任务中表现强劲,但基准稳定性与现实体验差异仍受关注。
Black Forest Labs 推出 FLUX 3,称其以统一架构覆盖图像、视频、音频与动作预测,FLUX 3 Video 已开放早期访问。
Poolside 联合 CEO Eiso Kant 介绍其模型工厂:小团队如何通过高频实验、数据流式训练和可复现实验,将模型从预训练推进到发布。
本期聚焦 Laguna S 2.1、OpenAI/Hugging Face 安全事件、Kimi K3 蒸馏争议,以及智能体平台、评测基础设施和模型路由的新进展。
近期 AI 网络安全相关动态密集出现:模型评测环境逃逸、专用安全模型发布、开放权重防御能力争论升温,显示行业关注点正从能力展示转向约束、治理与实战部署。
Xaira Therapeutics 押注高信息密度的数据生成,用于训练预测细胞扰动反应的模型。其经验显示,模型规模并非唯一瓶颈,数据中的信息量可能决定上限。
Thinky 推出 Inkling 模型家族:主模型为 975B 总参数、41B 激活参数的 MoE Transformer,支持 100 万 token 上下文,并开放权重。
Lila Sciences 试图把湿实验室变成由 AI 与机器人驱动的数据工厂,用大规模实验生成可验证的科学推理数据,探索“科学超级智能”的可能性。
Codex 与 ChatGPT Work 活跃用户数在短时间内从 600 万升至 700 万,年初至今增长约 10 倍。Claude Code 缺少同期更新,二者仍难直接比较。
GPT-5.6 发布后,普通用户看到的选择较少,但 API 用户面对大量模型变体。社区正在尝试用更简单的分组方式理解 Sol、Terra、Luna 等选项。
Cloudflare 推出 Precursor,通过客户端连续行为信号补充 Bot Management 与 Turnstile,在完整用户会话中识别自动化流量,并尽量减少对正常用户的打扰。
OpenAI 发布 GPT-5.6 三个尺寸版本,并引入 ultra 推理档位;同时 ChatGPT Work 与 Codex 桌面更新进一步强化其超级应用策略。
Lilian Weng 新文讨论 harness 与递归自我改进的关系,并梳理 ACE、Meta-Harnesses 等近期研究脉络。
Introspection 联合创始人 Roland Gavrilescu 讨论了 autoresearch、智能体“配方”、内外循环,以及为什么人类仍是自动化软件工厂的重要组成部分。
在 AI Engineer World’s Fair 上,“自动研究”成为焦点。多位演讲者围绕 AI 代理能否参与系统维护,以及外层决策权是否仍应由人类掌握展开讨论。
AI 社区今日重点集中在 Fable 5 重新上线、GLM-5.2 编码生态扩展、智能体记忆与工作流设计,以及面向安全和评测的新型智能体架构。
Paul Bakaus 认为,AI 设计代理需要领域知识、设计词汇和人类把控;技能工程的目标不是全自动,而是让人更精准地引导结果。


