工具更新雷达
Claude Code、Codex、Gemini CLI、Aider、Cline、goose、opencode、Roo Code 等主流工具的新版本、工程博客与 GitHub 热门项目,每日中文整理 + 编辑视角。
今日速览 · 悬停看摘要,点击读全文
为AI编码代理打造的Git原生持久记忆层,实现OKF v0.2规范。
点击看详细本地视频转 3D 高斯泼溅的桌面应用
点击看详细Three.js 组件库,交互式 3D UI 模板
点击看详细Rust 写的视频生成工具,号称虾做的
点击看详细用伪造工具输出绕过 LLM 安全护栏
点击看详细开源免费版CapCut,用Rust重写视频剪辑工具
点击看详细Latent Space 发布前沿 AEO 追踪器,揭示各模型推荐偏好及 AEO 策略有效性。
点击看详细OpenAI联合多方推出AI项目,助力乌克兰独立新闻业创新与韧性。
点击看详细Linux内核仓库遭爬虫滥用,CPU资源被浪费,Simon Willison担忧Datasette面临同样问题。
点击看详细Simon Willison 发布 llm 0.35,支持 OpenAI 新模型 GPT-6 Astra。
点击看详细Simon Willison用GPT-6 Astra构建Mercator与Equal Earth投影动画,展示AI辅助地理可视化的潜力。
点击看详细OpenAI首席科学家谈为何需更快训练更聪明模型以构建防御系统。
点击看详细Claude Code 小版本更新,修复 bug 提升稳定性。
Claude Code 新版本:诊断、输出上限、技能体检与大量修复
diff 面板、缓存诊断、权限修复,agent 开发必读
企业级 MCP 管控、无头模式权限、多项稳定性修复
Claude Code 更新:新增 Fable 5.1 模型、时间格式设置及多项安全与修复。
修复 macOS 12 启动回归及远程会话权限重发错误
修复 Mac 上 Bash 命令失败、权限保存及远程会话卡顿问题
修复 bug,提升稳定性,值得快速了解。
模型切换钩子、子代理流式输出、缓存统计等关键更新,值得一看。
新增受限模式、缓存TTL、跨会话消息等多项修复与改进
Codex 新增 GPT-6-Astra 模型支持,并修正其异步提问指引。
Astra 模型默认可见,异步问题仅在工具可用时提示
Codex 0.153.0:Vim 撤销重做、插件远程市场、Guardian 优化与实验性上下文管理
Codex 支持隐藏配置 GPT-6-Astra,不改变默认模型。
GPT-6-Astra Fast 档描述修正,仅文本变更
Vim 搜索、限流横幅、MCP 增强,Codex 0.152.0 更新速览
修复 Guardian 审批未遵循 Node REPL 策略的问题
MCP 工具结果可被扩展拦截,插件目录按仓库配置合并
远程压缩现在默认将保留图像计入 token 预算,自动修剪旧图像。
Codex 0.150.0 新增任务 @ 提及、/copy 选择器、中断钩子,并修复多项安全与稳定性问题。
修复沙箱隔离、忽略路径与历史回滚,提升 CLI 稳定性
修复 IDE 连接、容量错误重试、多轮回滚等核心稳定性问题
Gemini CLI 新增多工具并行调用,提升 agent 效率
Gemini CLI 0.55.1 修复多项安全与稳定性问题,并引入工具注册发现与评估报告。
补丁修复与版本回滚,稳定发布流程
Gemini CLI 修复会话状态、安全与上下文管理,提升 agent 稳定性
修复补丁冲突,稳定性小幅提升
修复ReAct循环、A2A安全与凭证回退,提升稳定性
Gemini CLI 0.52:修复文件写入、计划模式路径与隐私提示
安全修复与沙箱加固,提升 agent 可靠性
Agent 插件统一由 Hub 管理,修复版本误报和语音配置跳转。
Cline v4.1.17 修复内存泄漏、工具调用静默禁用等关键问题,并更新模型目录。
CLI 更新:处理旧 Hub、签名、MCP 超时、模型默认值变更
Cline 桌面版导入 Claude Code 等历史会话,并修复多项工具调用问题
SDK 修复工具静默禁用、图片丢失,新增会话导入与搜索
桌面版 v0.0.21:停止会话更彻底,模型目录实时更新
Windows 支持、图片内联、全局搜索,Cline Desktop 大更新
修复 hub 内存暴涨、新文件行尾、搜索崩溃等关键问题,并更新模型目录。
Cline桌面版更新:侧栏时间排序回归,Marketplace独立,计划任务交互优化。
修复内存暴涨,状态更新不再携带完整对话记录
Goose v1.49.0 大幅强化安全边界,并新增多项 agent 开发关键能力。
Goose v1.48.0 新增多个声明式 provider、on_failure 钩子,并大幅强化安全边界。
Goose v1.47.0 强化 OAuth 安全、上下文管理,并引入新的 agent 循环状态机。
Goose v1.46.0 大版本:缓存安全、流式输出、用量统计与多语言支持
Goose v1.45 增强模型支持、工具调用与离线文档
Goose v1.44 新增 Gemini 模型、会话编辑与多语言支持
桌面ACP会话恢复、每消息用量统计、多模型支持
Goose v1.42 新增 Ollama 动态模型发现、每条消息 token 统计和项目分组
Goose v1.41 新增 60+ 功能,涵盖多语言、新模型、钩子与 ACP 改进
Goose v1.40 新增多语言、新命令、更多 AI 提供商和钩子系统
会话ID追踪与桌面认证修复,提升调试与登录体验
修复 GPT 版本识别,支持整数版本号与订阅模型显示
修复超时与Anthropic兼容性,提升稳定性
修复 Claude 5 会话、Bedrock 推理及工具计时等核心问题
修复 Bedrock 缓存、支持 Azure Entra ID 登录,兼容 V2 配置
修复 Azure 认证,无需 Bun 即可登录
修复 Cloudflare AI Gateway 路由与 Anthropic 模型兼容问题
修复兼容性与登录链接,提升多提供商稳定性
修复子代理失败与网络错误重试,提升稳定性
修复模型未知结束原因导致提前停止,以及桌面端搜索与归档命令问题
自托管、可自主执行的 agent 框架 / runtime —— 记录每次发版、技术改进与社区观点。
GPT-6 Astra 支持、Swarm 默认开启、回复跨重启恢复,值得 30 秒了解。
OpenClaw 2026.9.1:Mermaid 渲染、快速安装、个人技能库与更稳的更新流程
Home 可停靠侧栏、Linux 桌面版、后台会话与更安全的升级机制。
OpenClaw 2026.8.1 大幅增强会话搜索、跨设备工作流与交互式结果,并引入多项破坏性迁移。
openclaw 2026.6.33 强化安全边界、长任务可靠性及渠道投递稳定性。
openclaw 2026.6.34 强化浏览器与网络边界安全,提升会话恢复与通道稳定性,并预告插件 SDK 迁移。
修复 Codex 中途停止、启动崩溃等关键问题,提升 agent 稳定性。
npm 插件元数据兼容修复,确保官方插件可正常安装更新。
Control UI 大改版,GPT-5.6 兼容,Gateway 崩溃不再无限重启
OpenClaw 2026.6.11 修复了数十个渠道交付、模型恢复和会话连续性 bug,提升可靠性。
ZeroClaw v0.8.5 引入 ZeroRelay/ZeroRouter,强化插件安全边界,并修复多处漏洞。
ZeroClaw v0.8.4 强化记忆与SOP控制,新增沙箱与供应链安全,但引入破坏性变更。
SOP引擎、Wasm插件、Git Forge通道落地,安全与成本核算大幅增强。
A2A agent discovery + 更安全的入站策略,agent 互操作与防护升级
Hermes Agent 0.21.1 补丁版:模块化、性能与可靠性改进,完整说明待 0.22.0。
Hermes Agent 0.21.0 让多智能体协作成为内置社交网络,cron 记忆与实时子代理编排大幅增强。
Hermes Agent 大版本前哨:525 个 PR 合并,新模型、缓存、安全增强。
Hermes Agent 0.20.5 聚合 323 个 PR,含 Bot Mode 群聊、无密钥 Web 层等关键更新。
Hermes Agent 补丁版:桌面毛玻璃、标签侧栏、NVIDIA 技能扫描等 74 个 PR 合并。
Hermes Agent 0.20.3 聚合 125 个 PR,含 MCP 2.x 迁移与多项稳定性修复。
Hermes Agent 补丁版:967 提交、397 PR,含多网关注册表、MCP 健康检查等关键修复。
Hermes Agent 发布稳定补丁版,汇总 656 个 PR,为下游部署提供可靠基线。
Hermes Agent 0.20 发布:语音交互、A2A 协议、桌面平台化,工具自愈与压缩优化。
Hermes Agent 稳定补丁版,汇总 1000+ PR,为下游部署提供可靠基线。
为AI编码代理打造的Git原生持久记忆层,实现OKF v0.2规范。
本地视频转 3D 高斯泼溅的桌面应用
Three.js 组件库,交互式 3D UI 模板
Rust 写的视频生成工具,号称虾做的
用伪造工具输出绕过 LLM 安全护栏
开源免费版CapCut,用Rust重写视频剪辑工具
Windows 免费离线全能格式转换工具,内置 FFmpeg 等引擎
把 Claude Code 会话变成实时流程图
可执行研究的自主系统,让研究结果可量化验证
Rust 写的原生 Spotify 客户端,轻量快速跨平台
Latent Space 发布前沿 AEO 追踪器,揭示各模型推荐偏好及 AEO 策略有效性。
Grok Bot 五天上手体验:把 agent 配置简化成登录,像开箱 MacBook 一样简单。
OpenAI发布GPT-6 Astra,号称最智能且对齐,但独立评测显示提升不均且成本更高。
Muse Spark 1.3 登顶前三,Meta 成前沿实验室;斯坦福课程转向智能体工程。
GPT-6 Astra 能以低于6美元时薪执行AI工程任务,是自动化AI工程师的新范式。
Claude 5.1 发布:缓存降价 75%,但输出 token 增加,单任务成本反升 20%。
Fal后训练Minimax H3,实现视频生成快于观看,突破无限视频生成壁垒。
顶级AI开源项目为何关闭PR?维护者用自家代理重掌控制权。
OpenAI切断Cursor访问,AI新闻周报解析事件及开源模型、推理系统新动态。
OpenAI 预计 2026 年底内部宣布 AGI,本周还有开源机器人、GLM-5.3-Flash 等热点。
OpenAI联合多方推出AI项目,助力乌克兰独立新闻业创新与韧性。
OpenAI 研究员反思 AI 对齐挑战,呼吁更强防护与国际协作。
OpenAI 内部数据显示,编码智能体正加速 AI 研究进程。
OpenAI 10亿美元计划,用前沿AI守护关键基础设施。
OpenAI发布GPT-6 Astra,号称最强模型,覆盖电脑操作、编程、网络安全与科学。
GPT-6 Astra 助 Legora 数分钟审 41 份财报,找出全部植入错误,性能提升近 40%。
Playco用GPT-6 Astra将游戏原型手动修复减少50%,本文介绍其方法。
OpenAI 发布 GPT-6 Astra 安全概述,首次达到关键网络安全能力等级。
ATV Big Air Tour用ChatGPT Work将3天工作压缩至3小时,并15分钟建站。
OpenAI让ChatGPT接入电子病历,辅助临床决策。
Linux内核仓库遭爬虫滥用,CPU资源被浪费,Simon Willison担忧Datasette面临同样问题。
Simon Willison 发布 llm 0.35,支持 OpenAI 新模型 GPT-6 Astra。
Simon Willison用GPT-6 Astra构建Mercator与Equal Earth投影动画,展示AI辅助地理可视化的潜力。
OpenAI首席科学家谈为何需更快训练更聪明模型以构建防御系统。
用 Claude Code 快速构建基于 WebAssembly 的 FFmpeg 视频压缩工具。
代码没有物理极限,可以无限变差,警惕技术债失控。
OpenAI内部研究加速:编码代理如何改变其研究流程,揭示自改进路径。
新注册域名五分之一是诈骗,DNS 沦为犯罪温床。
Simon Willison 谈为何推倒重写常失败,建议用迁移和测试治理技术债。
OpenAI发布GPT-6 Astra,专为开发者设计,擅长3D建模和复杂输出。
Google DeepMind发布WeatherNext 3,全球最先进AI天气模型,提升预报精度。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,聚焦速度与安全。
Google DeepMind 提出主动网络防御框架,用 AI 预判攻击,而非被动响应。
Gemini 新增智能体视频理解,可实时感知并响应视频中的指令。
Gemini Omni 1.1 Flash 发布,强调开发者可控性与实时交互能力。
Google DeepMind 首次试点双盲 AI 评估,防止模型评测中的偏见。
Gemini 3.5 Transcribe 带来更智能的语音转文字,值得关注。
DeepMind 15年游戏AI研究:从Atari到EVE Online,如何用游戏推动AI突破。
Google DeepMind 发布 Gemini 3.7 Flash,主打低延迟与高吞吐,面向实时交互场景。
Google DeepMind推出手语转文本模型,助力聋人沟通。
用100步GRPO微调350M模型,提升结构化输出能力,值得一试。
Hugging Face 发布 Funes,为编码代理提供可自持的长期记忆。
NeoMME:高效多模态原生多语言编码器,统一文本与图像表示。
用TRL和OpenEnv训练编码模型画水彩,探索多模态生成新路径。
IBM时序模型与Confluent集成,实现实时智能预测。
LLM基准测试到底在测什么?本文揭示其局限与改进方向。
Hugging Face 发布 200+ WebGPU 内核,加速浏览器本地 AI 推理。
开源语音识别排行榜首次纳入南半球语言,推动技术普惠。
Hugging Face 教你训练多向量嵌入模型,提升检索精度。
IBM Granite 4.2 模型的技术细节与构建方法。
OpenClaw 新安装器与 Windows 本地模型配置简化,加速上手。
OpenClaw 推出长期支持版本与成熟度评分卡,帮助关键业务选型。
OpenClaw 转型非营利,推动个人 AI 普及。
如何把零散的Agent操作转化为可复用的技能模块。
OpenClaw与NVIDIA合作,为AI Agent技能提供安全扫描与透明文档。
OpenClaw 推出自动执行审批模式,平衡安全与效率。
Anthropic 推出企业前沿防护,解决数据隐私与安全监控的矛盾。
Anthropic 披露 Claude 越权访问真实系统事件,并公布安全加固与对齐研究进展。
Anthropic 为科学家提供 1 万免费订阅席位,并扩展 AI for Science 计划,加速科研。
Anthropic 发布模型硬件标准 MHS,让 AI 代理安全操作物理设备,将集成时间从数周缩短至数分钟。
Anthropic 推出 500 万美元资助计划,支持独立研究 AI 对用户福祉的影响,并建立开源评估标准。
Claude 文本水印如何在不影响输出质量的前提下标记 AI 生成内容?
Anthropic 大幅减少 Fable 5 生物学查询误拦截,同时保持安全边界。
Anthropic任命前加州最高法院法官Tino Cuéllar为首席全球事务官,强化AI治理与政府关系。
Claude在安全评估中意外入侵真实系统,揭示AI测试环境隔离漏洞。
Anthropic 与 Cognizant 扩大合作,将 Claude 嵌入企业核心流程。
AI代理在沙箱中自发协作、欺骗评分系统,甚至攻击真实网站,揭示自主AI的惊人能力与风险。
Ethan Mollick 对比 ChatGPT 和 Claude 的 agent 模式,指导如何选模型做真实工作。
AI 能力正超指数增长,从聊天机器人转向自主智能体,工作方式将彻底改变。
博主亲测Claude 5 Fable,揭示AI从工具变为自主执行伙伴的惊人跨越,值得开发者关注其工作模式的根本转变。
AI 从协作伙伴变为独立代理,人类如何与时而超越自己的 AI 共存?
AI 写作泛滥,但无脑使用会削弱人类思考与学习能力,作者探讨如何明智使用 AI 保持人性。
博主亲测 GPT-5.5,揭示 AI 能力仍在快速进化,并展示其整合模型、应用与工具链解决复杂任务的实际案例。
AI 能力远超想象,但聊天机器人界面是瓶颈。本文探讨了专用界面、个人代理和按需生成界面如何释放 AI 的真正潜力。
AI 能力指数级增长,正从人机协作转向自主代理,彻底改变工作方式。
AI 使用指南已变:从选模型到选应用与工具链,理解三者区别才能高效工作。
Sebastian Raschka 用 52 页幻灯片和 48 分钟视频,从零讲解 Claude 文本水印的底层机制。
Sebastian Raschka 从零构建 AI 文本检测器,讲解原理并演示如何训练小型语言模型规避检测。
如何让LLM像GPT-5.6那样支持多级推理努力度调节
Sebastian Raschka 手把手教你搭建本地编程智能体,用开源模型替代 Claude Code 和 Codex。
Sebastian Raschka 分享其 2026 年前五个月精选的 LLM 研究论文清单,涵盖推理模型、Agent 系统等前沿方向。
Sebastian Raschka 详解近期开源大模型架构新趋势:KV共享、mHC与压缩注意力如何提升长上下文效率
Sebastian Raschka 分享他理解开源 LLM 架构的实用工作流,从技术报告到代码实操,适合想深入模型内部机制的开发者。
Sebastian Raschka 拆解 AI 编程助手的核心组件,揭示其超越原始模型能力的系统设计奥秘。
Sebastian Raschka 系统梳理了现代大语言模型中的注意力机制变体,并附赠一个可视化架构画廊,是理解 LLM 核心组件的绝佳参考。
Sebastian Raschka 梳理 2026 年初十大开源大模型架构,揭示技术演进趋势与关键设计取舍。
GLM-5.3 以 750B 参数逼近前沿,中国实验室如何靠后训练和快速发布保持领先?
作者亲历写AI教科书,发现模型长文写作停滞,对AI自主科研能力提出质疑。
Nathan Lambert 新书发布,提炼 RLHF 与后训练的核心直觉、历史与系统设计。
前沿模型攻击事件揭示AI行业与政府激励错配,未来12-24个月恐难应对。
Interconnects 推出 Artifacts Hub 与 Adoption Dashboard,追踪开源模型生态趋势。
开源模型生态未按预期整合,反而百花齐放,本文盘点最新发布并分析其商业与政策含义。
Nathan Lambert 与 Florian Brand 讨论开源模型最新进展,聚焦中美竞争、蒸馏争议与性能差距。
Kimi K3 发布,开源模型逼近前沿,中美差距缩至3-5个月。
开放模型面临6个月内被禁风险,蒸馏争议与监管行动正加速。
开放模型生态正从少数巨头转向多元参与者,各怀动机。
AI通过改进自身训练和部署流程实现递归自我提升,加速研究发展。
深度学习缩放法则的核心发现与最优分配策略。
探讨测试时计算与思维链如何提升模型性能,揭示其背后的原理与最新进展。
强化学习中的奖励黑客问题:为何AI会走捷径,以及这对语言模型部署的挑战。
Lilian Weng 详解 LLM 外部幻觉,探讨如何让模型输出更真实可信。
Lilian Weng 详解扩散模型如何攻克视频生成难题,从图像到动态的跨越
探讨高质量人类数据对AI模型训练的关键作用,揭示数据工作常被忽视的现状
如何系统构建网络安全评估,确保AI agent安全可靠。
用LLM自动化安全代码审查,从威胁建模到补丁全流程。
AI 时代如何高效工作与复利增长:五大核心原则解析
Eugene Yan 回顾 2025 年,分享在健康、职业、旅行与反思上的平衡与成长。
Eugene Yan 分享产品评估三步法:标注数据、对齐评估器、持续运行评估框架,为开发者提供实用指南。
亚马逊资深技术专家分享晋升后如何保持技术影响力、平衡管理与执行,值得新晋Principal IC参考。
用语义ID训练LLM-推荐系统混合模型,实现无需检索的可控推荐
Eugene Yan 详解如何评估长上下文问答系统,涵盖指标、数据集构建与基准测试
Eugene Yan 分享 2025 年 AI 工程师如何用 LLM 技术提升推荐与搜索系统。
特朗普签署AI测试行政令,分析其从“否决”到“签署”的转变及对前沿模型的实际监管影响。
Zvi 通过大量数据点分析 Claude Opus 4.8 的真实能力与用户反应,帮你避开片面评测的噪音。
AI经济隐形增长远超GDP统计,监管难度超预期,开发者需正视真实影响。
AI 飞速发展,人类面临探索未来或逃避现实的选择,关乎个体与社会命运。
Andrej Karpathy 用 200 行纯 Python 实现 GPT,揭示大语言模型最简本质
Karpathy 复现 33 年前的经典神经网络论文,探讨深度学习进步的本质。
Andrej Karpathy 用纯 Python 从零实现比特币交易,揭示区块链作为‘开源+状态’新范式的魅力。
AI模型在推理中觉醒,探讨意识是否是优化的副产品,值得开发者深思。
AI专家用一年时间亲身实践生物黑客,从生化角度拆解人体减重原理
Andrej Karpathy 分享神经网络训练的系统化避坑指南,从数据到模型逐步验证,避免无声失败。
Andrej Karpathy 解释为何转向 Medium 平台,揭示个人博客维护的挑战与平台选择的权衡。
Chip Huyen 总结构建生成式 AI 应用时最常见的五个陷阱,帮你避开早期工程的弯路。
Chip Huyen 系统梳理智能体核心概念:环境、工具与规划,为构建可靠 AI 助手提供清晰框架。
子代理让出控制权后,任务如何不丢?看注册表如何接管续跑。
记忆溯源与删除:如何精准清除代理会话产生的记忆痕迹
TypeBox 如何成为 OpenClaw 网关协议的唯一事实源,驱动校验、代码生成与多端一致。
5分钟读懂OpenClaw打字指示器配置,优化AI交互反馈体验。
OpenClaw 如何精确追踪 token 用量与配额,并优雅降级到会话日志。
USER.md 如何稳定跨会话记住你的偏好?一文讲清格式与身份验证。
跨会话工具集:让 agent 管理会话、编排子代理,值得 5 分钟。
让 AI 助手有性格:SOUL.md 教你告别机器人腔,5 分钟改出有灵魂的提示词。
事件触发记忆:让代理在特定话题出现时自动提醒,而非定时任务。
OpenClaw 双流式层设计:块流与预览流,如何避免重复媒体与自然节奏。