Anthropic 新旗舰:强调 agent 写码与知识工作,宣称典型负载成本比 Opus 5 低约 40%。今天的模型发布潮里,这是最直接关系到「把 agent 当日常生产力」的一条。
A little signal.A lot less noise.
Developer news, AI research, and ideas worth keeping. Gathered daily, with the source always one click away.
Good things,
all in one place.
In the loop
OpenAI 同时推出两条线:Sol / Luna 在能力与成本之间做不同权衡,面向日常工作。和 Opus 5.5 同一天刷屏,适合对照定价与代理场景再决定默认用哪一家。
Unreal Labs 开源/公开一套 harness,称在生产负载与 coding/science 基准上相对 Codex 可省到约 40% 成本、性能不掉。和「拆 harness / 多智能体科研管线」同一层:价值往往在编排与调用策略,不在换底模。
Arcturus 论点:Jev 类「类型安全决策/分类」若真正好用,OpenAI 有条件快速跟进——他们早就把 LLM 当隐式分类器,缺的是专门训练与产品包装;一旦补上,还能塞进自家模型与 agent,这是 Jev 难复制的组合拳。昨天看过 Kev/决策小模型的话,这篇是「大厂会不会收编这条赛道」的清醒对照。另有 Show HN:JevBench(52 套 Jev 类系统、534 决策)可当量化底表。
从 SSO 产业史拆 XML 规范化、签名包裹、「厨房水槽」式扩展与僵化,结论几乎条条路通向 OIDC。还在维护企业 SAML 集成或排认证坑的人,这篇能省很多「为什么这么脆」的摸索。
官方安全公告:页面模板解析存在未认证 path traversal,在特定条件下可到远程代码执行。自建/托管 WordPress 应立刻核对版本与补丁,别当成「只有插件才中招」。
面向「隔离程序和 coding agent、又不离开熟悉 shell」的沙箱;文档直接拿 Claude 当演示对象。本地跑不可信 agent / 脚本时,比自己拼 firejail/容器更省事的一条候选。
Max Woolf:让 agent 反复改性能,直到超过领域里常见库。不是魔法论文,而是「agent 写码时代怎么把基准当验收」的长文案例;和 Opus/GPT 同日读,正好对照「模型更强之后,循环怎么设」。
Nothing here, just yet.
Try another keyword or browse all dates.