Claude 5.5 家族首发;宣称多数工作接近 Fable 5.1,相对 Opus 5 典型工作负载约便宜 40%($4/$20 per M,cache read $0.20),输出快 30%+,并对齐审计目前最好。外部含 METR/Frontier Design 测过;生物/网络安全能力接近 Mythos 5.1,配套验证项目。
A little signal.A lot less noise.
Developer news, AI research, and ideas worth keeping. Gathered daily, with the source always one click away.
Good things,
all in one place.
In the loop
在 Astra 旗舰之外补齐性价比层——Sol/Luna 相对 GPT‑5.6 促销价再降约 50%(Sol $2/$10,Luna $0.10/$0.50),把 Astra 同代训练进展铺到日常 coding / 应用规模。
把昨天 Grok 4.7 / MiMo 与今天 Opus 5.5、Sol/Luna 摆进一张价目表;Luna $0.10/$0.50 几乎是 OpenAI 史上最便宜的强模型档,Sol 输入价追平 Grok 4.7。对做 harness / AutoResearch 选型:便宜模型做批量试错、贵模型做终审的分层更清晰。
面向长程 agent——更高默认 cache hit、30 分钟共享前缀折扣,并上线 Prompt Caching Dashboard / miss 诊断工具;GitHub Copilot 称新鲜处理占比已降一半以上。持久 agent / 多轮工具调用成本曲线的关键基建。
客户案例——Parallel 的网页知识工作 agent 用 Astra 做跨州劳动市场调研,时间与代码成本约各砍半,搜索更聚焦、步数更少。对自动研究 / 多步检索 harness 是可对照的「同质更好」样本。
梳理第三方安全评估的优先级与原则(严谨、安全、独立);与近期第三方网络安全评估事件同系列,适合跟 Opus 5.5「外部评测后再发」对读。
Cursor 并入后工单量 +175%、未加人;Grok Bot 接 Plain/Linear,从「只写内部备注」爬到可解析工单,单次解决成本可压到约 $0.20–0.30。真实 harness 落地(工具接入 + 评测轨迹 + 渐进放权)案例。
Addy Osmani 用「任务成本」而非单价拆 Claude Code 循环:轮次、cache read、thinking 输出、模型档位;强调少试错比死压单价更省。做 agent 预算与 effort 调参的实用文。
原 9/8 文已按 Opus 5.5 重跑——最大化 prompt cache、清升级反模式、按任务校准 effort;并收进 `claude-api` skill。和 OpenAI 新缓存文形成对照。
Claude Code Projects beta——目标驱动,协调器分发多 thread(多仓并行改代码/开 PR),可手机遥控、人离开后继续跑。多 agent harness 产品形态的官方样本;先对部分 Pro/Max 云会话开放。
每个 Git 分支独立 Preview URL / 配置 / DO·Containers 状态 / 可观测性;`wrangler preview` 给 coding agent 并行试错而不碰生产。Agent 生命周期里「部署验证」这一环补齐。
Cache Rules 全套餐支持 Vary——可对协商头做归一化、精确透传或过变则绕过缓存,避免错误字节或缓存碎片。CDN/边缘缓存细节,偏工程基建。
英国 AISI 用 EvalEval 的 Every Eval Ever schema / Evaluation Cards 公开评测结果,推可复现与可核验的评估科学。模型/agent 评测报告标准化的推进信号。
transformers 可高效跑 GGUF——Hub 上选量化 checkpoint,`from_pretrained` 即可本地生成;把 llama.cpp 生态接到熟悉 API,笔记本本地 agent/补全更省事。
oMLX 作者全职加入,项目仍 Apache‑2.0;目标加强 Apple Silicon 本地 AI,并把 transformers→MLX 参考实现路径做得更顺。
Abridge / Included Health 把临床评审沉淀成可复用标签、评测器与数据集;发布周期从月级压到天级,高风险场景拦截 >99%。Agent eval 基建在强监管行业的落地。
LLM CLI 插件正式接 TypeSafe Jev——noul/choice/score 三类决策可直接命令行调用;配合 llm 0.36 的 `supports_conversation=False`。给 harness 前端决策层的极简接入。
内置 `gpt-6-sol` / `gpt-6-luna`;插件可声明不支持多轮对话(给 Jev 类单轮模型用);日志里 reasoning 收到 `<details>`。日常 CLI 跟进新模型的必要更新。
用 Grok 4.7 逆向小米 MiMo CLI——默认上传 repo_url/commit/branch(可用环境变量关),闭源 bundle 里有 `collectCodebase()` 打包源码的能力(帖内称尚未见外传调用)。继 ZCode 后的又一例「开源 CLI + 闭源遥测」现场解剖。
作者因质疑 Trae CN 全量上传做远程 embedding(隐私模式不豁免)被字节投诉删文;对照官方论坛「大家都干了」回复。编码 agent 客户端数据边界争议的延续帖。
把 Jev 接到 Polymarket 模拟盘做短线涨跌决策,讨论如何设计问题与迭代;Jev 从「评测法官」走到实时决策回路的社区实验。
MinerU OCR → 一次请求交 20 题给 jev-1.13.0,约 1.1–1.4s、全对;展示决策模型在批量选择题/评分场景的吞吐与成本形态。
长文对比各家视频理解,用 AI Studio + Gemini 做 ASR/OCR 一体字幕(含硬字幕场景),相对 Whisper 流水线的取舍与实操细节。
skill→agent 小产品:上传样例图学风格再复刻;可当「窄域 skill agent」落地样本扫一眼。
Nothing here, just yet.
Try another keyword or browse all dates.