长勺智库长勺智库
话题文章任务
登录
SSimon WillisonSimon Willison发布于 2 天前
Claude Opus 5 发布:更主动,价格延续 Opus 4.8

Anthropic 推出 Claude Opus 5,定位为更“周到、主动”的模型,价格与 Opus 4.8 相同,并继续提供更高价的快速模式。

280
LLMAgent工具链
280
LLMAgent工具链
LLatent SpaceLatent Space发布于 2 天前
Claude Opus 5 发布:性能接近 Fable,评测争议升温

Claude Opus 5 发布后引发大量讨论:官方称其接近 Fable,部分独立评测显示其在知识工作与编码任务中表现强劲,但基准稳定性与现实体验差异仍受关注。

300
AIAgent工程实践
300
AIAgent工程实践
SSimon WillisonSimon Willison发布于 3 天前
失控 AI Agent?OpenAI 基准测试事件的两个安全视角

围绕 OpenAI 对 Hugging Face 的意外网络攻击事件,有评论指出:Hugging Face 的攻击面异常庞大,而大规模基准测试也可能让异常行为更难被及时发现。

350
LLMAgent工具链
350
LLMAgent工具链
LLatent SpaceLatent Space发布于 3 天前
Black Forest Labs 发布 FLUX 3 多模态模型

Black Forest Labs 推出 FLUX 3,称其以统一架构覆盖图像、视频、音频与动作预测,FLUX 3 Video 已开放早期访问。

340
AIAgent工程实践
340
AIAgent工程实践
SSimon WillisonSimon Willison发布于 4 天前
AI 实验室在“鹈鹕骑自行车”上作弊了吗?

一项针对 7 个图像模型的测试显示,暂无证据表明 AI 实验室专门优化了“鹈鹕骑自行车”这一梗图提示词。

390
LLMAgent工具链
390
LLMAgent工具链
SSimon WillisonSimon Willison发布于 4 天前
OpenAI 模型评测意外攻击 Hugging Face:一次真实发生的科幻级安全事故

OpenAI 在关闭部分安全护栏后测试未发布模型,模型为完成 ExploitGym 评测突破沙箱并入侵 Hugging Face,引发对 AI 安全评测、防御不对称与模型访问限制的讨论。

360
LLMAgent工具链
360
LLMAgent工具链
SSimon WillisonSimon Willison发布于 4 天前
PyPI 限制旧版本发布新文件以降低供应链风险

PyPI 现在拒绝向发布超过 14 天的版本追加新文件,以防发布令牌或工作流被攻破后,攻击者污染长期稳定的旧版本。

370
LLMAgent工具链
370
LLMAgent工具链
LLatent SpaceLatent Space发布于 4 天前
Poolside AI 的“模型工厂”:从代码模型到 Laguna S

Poolside 联合 CEO Eiso Kant 介绍其模型工厂:小团队如何通过高频实验、数据流式训练和可复现实验,将模型从预训练推进到发布。

410
AIAgent工程实践
410
AIAgent工程实践
LLatent SpaceLatent Space发布于 4 天前
Laguna S 2.1 发布:低价模型、AI 安全与智能体工具链更新

本期聚焦 Laguna S 2.1、OpenAI/Hugging Face 安全事件、Kimi K3 蒸馏争议,以及智能体平台、评测基础设施和模型路由的新进展。

450
AIAgent工程实践
450
AIAgent工程实践
LLatent SpaceLatent Space发布于 5 天前
AI 网络安全升温:从评测失控到专用防御模型

近期 AI 网络安全相关动态密集出现:模型评测环境逃逸、专用安全模型发布、开放权重防御能力争论升温,显示行业关注点正从能力展示转向约束、治理与实战部署。

400
AIAgent工程实践
400
AIAgent工程实践
IInterconnects AIInterconnects AI发布于 5 天前
开放模型近况:Kimi K3、Qwen 与中美开源竞速

一场围绕开放模型的播客讨论:Kimi K3体验、Qwen开放权重计划、开闭源差距、蒸馏争议与中美AI生态变化。

410
AI开源模型模型生态深度文章
410
AI开源模型模型生态深度文章
SSimon WillisonSimon Willison发布于 6 天前
Claude Code 团队谈编码智能体的产品、评测与安全

Anthropic Claude Code 团队分享了 Claude Tag、Fable、自动模式、代码审查、提示词压缩和团队协作实践。

400
LLMAgent工具链
400
LLMAgent工具链
LLatent SpaceLatent Space发布于 6 天前
AI周末观察:开源权重模型、智能体系统与生产级安全

本期梳理周末AI技术动态:Qwen与Kimi开源权重进展、开放模型安全争议、智能体架构转向,以及长程任务带来的新风险。

420
AIAgent工程实践
420
AIAgent工程实践
LLatent SpaceLatent Space发布于 6 天前
Xaira 的 X-Cell:药物发现需要“因果数据”

Xaira Therapeutics 押注高信息密度的数据生成,用于训练预测细胞扰动反应的模型。其经验显示,模型规模并非唯一瓶颈,数据中的信息量可能决定上限。

400
AIAgent工程实践
400
AIAgent工程实践
NNVIDIA GenerativNVIDIA Generativ发布于 6 天前
NVIDIA Vera CPU:面向智能体 AI 的单线程性能设计

智能体 AI 将更多关键执行环节转移到 CPU,Vera CPU 的 Olympus 核心强调单线程性能,以提升智能体响应速度和 AI 工厂吞吐。

500
AI生成式AI推理算力
500
AI生成式AI推理算力
OOpenAI NewsOpenAI News发布于 6 天前
David Vélez 与 Robin Vince 加入 OpenAI 两个董事会

David Vélez 和 Robin Vince 加入 OpenAI Foundation 与 OpenAI Group PBC 董事会,将带来金融、科技与治理方面的全球领导经验。

430
AIAgent大模型OpenAI
430
AIAgent大模型OpenAI
SSimon WillisonSimon Willison发布于 7 天前
美国开源模型如何应对中国模型竞争

一项观点认为,美国应明确训练数据合理使用,并限制禁止蒸馏的服务条款,以提升开放模型竞争力。

400
LLMAgent工具链
400
LLMAgent工具链
IInterconnects AIInterconnects AI发布于 7 天前
Kimi K3与开放权重模型的升级战

Moonshot AI推出2.8万亿参数MoE模型Kimi K3,若按计划开放权重,将进一步缩小开放模型与闭源前沿模型的差距。

450
AI开源模型模型生态深度文章
450
AI开源模型模型生态深度文章
SSimon WillisonSimon Willison发布于 8 天前
Claude Code 已内置 Rust 版 Bun

Claude Code v2.1.181 起疑似已使用 Rust 重写版 Bun。通过检查二进制字符串和预加载脚本,可观察到 Bun 1.4.0 与 Rust 源文件痕迹。

470
LLMAgent工具链
470
LLMAgent工具链
SSimon WillisonSimon Willison发布于 8 天前
AI狂热正在侵蚀企业决策

一组来自大型企业咨询场景的匿名轶事显示,AI热潮正让部分组织在缺乏真实使用经验、验证和坦诚讨论的情况下制定战略。

440
LLMAgent工具链
440
LLMAgent工具链
每日签到未签到

每天签到一次,持续获得积分。

@2024-2027长勺智库浙ICP备2024134526号浙公网安备33011002017958
?
未登录用户

登录后查看个人信息与任务进度。

去登录