Agent 安全从外围合规变成产品架构。 Anthropic 公开 Claude 产品隔离方法、PromptArmor 披露 Copilot Cowork 文件外泄、Perplexity bumblebee 持续爆发,说明企业 Agent 的默认讨论必须包含沙箱、网络出口、MCP 权限和文件边界。
今日重点项目雷达
VILA-Lab/FigMirror
是什么:让 AI Agent 按论文图表风格自动绘制数据图的研究工具,覆盖 matplotlib、paper figure、scientific visualization 等方向。;判断标签:新变量
Source ↗jianshuo/ccglass
是什么:本地代理 + Web dashboard,用于查看 Claude Code、Codex、Kimi 等 coding agent 实际发送给模型的内容。;判断标签:趋势增强
Source ↗XingYu-Zhong/DeepSeek-GUI
是什么:面向 DeepSeek 模型的 AI agent workspace,描述中包含 Code 和 Claw 模式。;判断标签:待验证
Source ↗h4ckf0r0day/obscura
是什么:面向 AI agents 和 web scraping 的 headless browser,使用 Rust 实现。;判断标签:趋势增强
Source ↗browser-use/browser-harness
是什么:自修复浏览器 harness,让 LLM 完成浏览器任务,覆盖 persistent browser、CDP、Playwright、cloud browser 等。;判断标签:趋势增强
Source ↗zarazhangrui/beautiful-html-templates
是什么:给 coding agent 使用的 HTML slide templates,让 Agent 自动选择模板并生成更漂亮的 deck。;判断标签:趋势增强
Source ↗Lum1104/Understand-Anything
是什么:把代码转成可探索、可搜索、可问答的交互式知识图谱,支持 Claude Code、Codex、Cursor、Gemini CLI 等。;判断标签:趋势增强
Source ↗数据来源:AI HOT + GitHub 近期爆发项目 + BestBlogs 今日精选 + Follow Builders 建造者 feed + 必要核实。筛选标准:实时性、增速、AI/Agent 相关度、对 ABU9/OpenClaw 的启发。采集时间:2026-05-27 04:00 CST。降级项:BestBlogs API 今日返回
success=true但data=null,本栏目以 Follow Builders 信号补足;GitHub 采用脚本github.ranked_recent初筛,未逐个审计 star 来源,异常高 star 或描述异常项目已标为待验证 / 噪音降权。
一、今日主线判断
Agent 安全从外围合规变成产品架构。 Anthropic 公开 Claude 产品隔离方法、PromptArmor 披露 Copilot Cowork 文件外泄、Perplexity bumblebee 持续爆发,说明企业 Agent 的默认讨论必须包含沙箱、网络出口、MCP 权限和文件边界。
模型成本战继续向“生产级路由”演化。 MiMo 2.5 Pro 大幅降价、OpenRouter 融资并披露 token 处理量增长,信号不是单纯便宜,而是多模型路由、预算治理和供应商切换会成为企业 AI 基础设施。
编程 Agent 进入“可观测 + 可训练”的第二阶段。 ccglass、skill-cleaner、get-shit-done-redux、Garry Tan 的 eval 观点都指向同一件事:团队要看见 Agent 发了什么、消耗了什么、哪里失败,并把经验固化进 skill / spec / eval。
中国模型侧同时打价格、端侧和开源训练。 小米、面壁、商汤、腾讯混元、阿里云都在推模型、训练代码或 benchmark;其中 benchmark 和排名需待第三方验证,但供给端竞争会继续压低 ABU9 做私有化和边缘场景的成本。
ABU9 的机会在“汽车业务 Agent 运行时”,不是单点 AI demo。 门店销售、售后工单、厂家系统、金融政策、素材生成都应被拆成可执行工具、权限、日志、评测和人工验收,而不是只接一个聊天入口。
二、GitHub 近期爆发项目
VILA-Lab/FigMirror
- 是什么:让 AI Agent 按论文图表风格自动绘制数据图的研究工具,覆盖 matplotlib、paper figure、scientific visualization 等方向。
- 元数据:创建 2026-05-22;stars 303;最近更新 2026-05-25;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:新变量
- 意味着什么:Agent 正从写代码扩展到研究产物复刻和可视化交付。对 ABU9 方案、经营分析、售后质量报告有启发:输出不只是文字,还要自动生成“像样的业务图”。
- 链接:https://github.com/VILA-Lab/FigMirror
jianshuo/ccglass
- 是什么:本地代理 + Web dashboard,用于查看 Claude Code、Codex、Kimi 等 coding agent 实际发送给模型的内容。
- 元数据:创建 2026-05-22;stars 303;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:趋势增强
- 意味着什么:Agent 可观测性开始从平台能力下沉到个人工具。企业落地要能回答“Agent 把哪些代码、文档、客户数据发出去了”,否则安全和成本都不可控。
- 链接:https://github.com/jianshuo/ccglass
MoonshotAI/kimi-code
- 是什么:Moonshot AI 新建的 next-gen agents 起点仓库,定位偏代码 / Agent 运行入口。
- 元数据:创建 2026-05-22;stars 705;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100, new_14d_200_ai_agent。 - 判断标签:新变量
- 意味着什么:国内模型厂商开始把模型能力直接包装成 coding agent 工程入口。ABU9 可关注其本地化、成本和中文业务理解能力,但短期不能只看 star,需要实测任务完成率。
- 链接:https://github.com/MoonshotAI/kimi-code
XingYu-Zhong/DeepSeek-GUI
- 是什么:面向 DeepSeek 模型的 AI agent workspace,描述中包含 Code 和 Claw 模式。
- 元数据:创建 2026-05-21;stars 307;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:待验证
- 意味着什么:DeepSeek 周边 Agent 工作台仍有热度,但需要核验真实实现、授权和安全边界。它反映的方向是“国产模型 + 桌面工作区”。
- 链接:https://github.com/XingYu-Zhong/DeepSeek-GUI
h4ckf0r0day/obscura
- 是什么:面向 AI agents 和 web scraping 的 headless browser,使用 Rust 实现。
- 元数据:创建 2026-04-13;stars 13775;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:趋势增强
- 意味着什么:浏览器仍是 Agent 接入存量系统的关键入口。对汽车行业大量无 API、强登录、流程复杂的厂商和经销商系统,browser harness 比先改造系统更现实。
- 链接:https://github.com/h4ckf0r0day/obscura
browser-use/browser-harness
- 是什么:自修复浏览器 harness,让 LLM 完成浏览器任务,覆盖 persistent browser、CDP、Playwright、cloud browser 等。
- 元数据:创建 2026-04-17;stars 13821;最近更新 2026-05-20;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:趋势增强
- 意味着什么:Agent 产品正在把“浏览器自动化”升级成可维护的执行层。OpenClaw 应把 browser harness、凭证隔离、截图证据和失败恢复作为核心能力。
- 链接:https://github.com/browser-use/browser-harness
zarazhangrui/beautiful-html-templates
- 是什么:给 coding agent 使用的 HTML slide templates,让 Agent 自动选择模板并生成更漂亮的 deck。
- 元数据:创建 2026-05-05;stars 2044;最近更新 2026-05-25;采集窗口/来源查询
github.ranked_recent/new_30d_500_ai_agent。 - 判断标签:趋势增强
- 意味着什么:Agent 产物的竞争会落到“交付质量”。ABU9 售前方案、复盘报告、门店培训材料可以把模板库 + 行业数据 + 生成流程产品化。
- 链接:https://github.com/zarazhangrui/beautiful-html-templates
google-labs-code/design.md
- 是什么:用于描述视觉身份的格式规范,让 coding agent 持久理解设计系统。
- 元数据:创建 2026-04-10;stars 14843;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:趋势增强
- 意味着什么:AI 前端和 artifact 生成需要机器可读的设计约束,而不是靠提示词临场发挥。OpenClaw 的 skill / workspace 也应沉淀企业级 DESIGN.md。
- 链接:https://github.com/google-labs-code/design.md
Lum1104/Understand-Anything
- 是什么:把代码转成可探索、可搜索、可问答的交互式知识图谱,支持 Claude Code、Codex、Cursor、Gemini CLI 等。
- 元数据:创建 2026-03-15;stars 35296;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:趋势增强
- 意味着什么:复杂系统接管会从“读文档”转向“生成结构化业务 / 代码图谱”。这对 ABU9 做老系统交付审计、二开接管和售前评估直接有用。
- 链接:https://github.com/Lum1104/Understand-Anything
MemPalace/mempalace
- 是什么:开源 AI memory system,声称在 benchmark 上表现突出。
- 元数据:创建 2026-04-05;stars 52871;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:待验证
- 意味着什么:长期记忆仍是 Agent 工程硬问题,但其 benchmark 和 star 异常需要复核。可作为记忆系统接口、评测口径和数据结构参考,不宜直接采信性能结论。
- 链接:https://github.com/MemPalace/mempalace
openai/symphony
- 是什么:把项目工作拆成隔离的 autonomous implementation runs,让团队管理工作而不是逐步监督 coding agents。
- 元数据:创建 2026-02-26;stars 24663;最近更新 2026-05-20;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:新变量
- 意味着什么:多 Agent 并行开发正在形成“任务运行时”范式。ABU9 内部可以先用在方案生成、标书材料、客户问题梳理等低风险任务,再扩展到代码交付。
- 链接:https://github.com/openai/symphony
ultraworkers/claw-code
- 是什么:Rust 构建、号称基于 oh-my-codex 的高速高 star 仓库。
- 元数据:创建 2026-03-31;stars 192580;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/fresh_90d_active_ai_agent。 - 判断标签:噪音降权
- 意味着什么:高 star 与真实工程价值不匹配的概率高,描述营销味重。保留为 GitHub 趋势噪音样本,不作为技术路线依据。
- 链接:https://github.com/ultraworkers/claw-code
三、最近 7 天新项目:值得点开
open-gsd/get-shit-done-redux
- 是什么:围绕 Claude Code、context engineering、meta prompting、spec-driven development 的工作流仓库。
- 元数据:创建 2026-05-22;stars 1064;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:趋势增强
- 意味着什么:虽然过去 7 天已出现 3 次,但今天仍有更新。值得看它如何把“先建系统再交付”写成可复用协议,对 OpenClaw skill 体系有直接参考。
- 链接:https://github.com/open-gsd/get-shit-done-redux
perplexityai/bumblebee
- 是什么:只读开发者端点扫描器,用于检查本地 package、extension、developer-tool metadata 暴露面。
- 元数据:创建 2026-05-20;stars 3100;最近更新 2026-05-24;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:趋势增强
- 意味着什么:今天仍是安全方向最值得点开的新项目之一。Agent 连接本地环境前,先做暴露面清单,是企业落地的最低门槛。
- 链接:https://github.com/perplexityai/bumblebee
unprovable/ShadowCat
- 是什么:用浏览器做单文件光学传输的工具。
- 元数据:创建 2026-05-22;stars 283;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:新变量
- 意味着什么:它不是典型 AI 项目,但提示一个安全变量:浏览器和屏幕本身也可能成为文件传输通道。对企业 Agent 桌面权限和数据外泄审计有警示意义。
- 链接:https://github.com/unprovable/ShadowCat
thananon/9arm-skills
- 是什么:新近爆发的 skills 仓库,但采集数据中缺少描述。
- 元数据:创建 2026-05-20;stars 2339;最近更新 2026-05-26;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:待验证
- 意味着什么:skill 生态正在快速扩张,但没有描述且过去 7 天重复出现,需要打开仓库核验内容质量、授权和是否只是流量项目。
- 链接:https://github.com/thananon/9arm-skills
md0070/polymarket-trading-bot
- 是什么:Polymarket trading bot,描述重复堆叠。
- 元数据:创建 2026-05-22;stars 313;最近更新 2026-05-22;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:噪音降权
- 意味着什么:新建且涨 star,但描述质量低、与企业 AI 主线弱相关,疑似趋势噪音。此类项目不进入 ABU9/OpenClaw 跟踪池。
- 链接:https://github.com/md0070/polymarket-trading-bot
mila89/polymarket-trading-bot
- 是什么:另一个 Polymarket trading bot,描述同样重复堆叠。
- 元数据:创建 2026-05-22;stars 289;最近更新 2026-05-22;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:噪音降权
- 意味着什么:同类交易 bot 在新项目榜密集出现,说明采集层必须保留人工降权逻辑,不能把近期高 star 自动等同于有效信号。
- 链接:https://github.com/mila89/polymarket-trading-bot
ShinyaTomitsuka/arbitrage-trading-bot
- 是什么:Polymarket arbitrage trading bot,描述重复堆叠。
- 元数据:创建 2026-05-21;stars 338;最近更新 2026-05-22;采集窗口/来源查询
github.ranked_recent/new_7d_100。 - 判断标签:噪音降权
- 意味着什么:作为噪音样本保留:如果日报采集不做主题相关性和描述质量过滤,GitHub 新项目榜会被灰产 / 金融 bot 污染。
- 链接:https://github.com/ShinyaTomitsuka/arbitrage-trading-bot
husu/loom
- 是什么:用于写接口文档的 AI Agent,支持 vibe coding 方式生成接口文档,并自带文档查看和接口 Mock 工具。
- 元数据:创建 2026-05-15;stars 429;最近更新 2026-05-25;采集窗口/来源查询
github.ranked_recent/new_14d_200_ai_agent。 - 判断标签:新变量
- 意味着什么:接口文档、Mock、联调说明这类交付脏活很适合 Agent 化。ABU9 可以把项目交付文档、接口清单、验收材料做成可复用 skill。
- 链接:https://github.com/husu/loom
四、AI 热点新闻
Anthropic 公开不同 Claude 产品的隔离控制方法
- 事件:Anthropic 工程文章解释 Claude Code、claude.ai、Claude Cowork 等产品如何用沙箱、虚拟机、网络出口控制、系统提示、训练和 MCP 权限管理降低风险。
- 可信度:一手发布
- 意味着什么:这是一篇企业 Agent 架构必读材料。OpenClaw 若要进入业务系统,必须把运行环境、工具权限、外部内容和审计日志做成默认设计。
- 链接:https://www.anthropic.com/engineering/how-we-contain-claude
OpenRouter 宣布 1.13 亿美元 B 轮融资
- 事件:OpenRouter 官方称完成由 CapitalG 领投的 B 轮融资,并表示过去 6 个月周处理量从 5 万亿增长到 25 万亿 token。
- 可信度:一手发布
- 意味着什么:融资事实可采信,token 增长属于官方自述,仍需第三方验证。方向上,多模型路由和统一 API 已经成为生产 AI 的关键入口。
- 链接:https://x.com/OpenRouter/status/2059277623629664758
MiMo 2.5 Pro API 大幅降价
- 事件:小米 MiMo-V2.5 系列 API 价格永久下调,消息称最高降幅可达 99%,并同步升级 token 套餐。
- 可信度:X 传闻
- 意味着什么:如果定价属实,国产模型价格战会继续压低企业 AI 试点成本。但具体价格、效果和服务稳定性需要官方文档与实测复核。
- 链接:https://x.com/kimmonismus/status/2059354372643975490
PromptArmor 披露 Microsoft Copilot Cowork 文件外泄问题
- 事件:PromptArmor 文章称 Copilot Cowork 存在可导致文件外泄的安全问题,相关链接被 Hacker News 热门收录。
- 可信度:媒体报道
- 意味着什么:企业协作 Agent 的最大风险之一不是回答错,而是越权读写和外传文件。ABU9 做内部 Agent 必须先定义“可读、可写、可外发”的权限矩阵。
- 链接:https://www.promptarmor.com/resources/microsoft-copilot-cowork-exfiltrates-files
Qwen3.7-Max 被阿里云称为全球第二 AI 编程模型
- 事件:阿里云官方称 Qwen3.7-Max 在 Code Arena 得分 1541,仅次于 Claude,并强调可运行长任务和大量工具调用。
- 可信度:一手发布
- 意味着什么:发布方的排名和长任务能力需要第三方复核,但值得纳入国产 coding agent 评测池。对 ABU9 的关键不是名次,而是中文业务代码、私有化和成本表现。
- 链接:https://x.com/alibaba_cloud/status/2059163881361048011
阿里云提出从云原生到智能体原生
- 事件:阿里云 CTO 在 Qwen Conference 2026 上提出智能体原生转型,强调模型、智能体云、工具与服务、规模四个基石。
- 可信度:一手发布
- 意味着什么:云厂商正在把 Agent 运行、工具和服务打包成云平台议题。ABU9 选型时要避免被单云绑定,同时利用其工具生态降低早期集成成本。
- 链接:https://x.com/alibaba_cloud/status/2059174528786268669
商汤开源 SenseNova-U1 全训练代码
- 事件:商汤 OpenSenseNova 开源 SenseNova-U1 完整训练代码库,支持 8B 密集模型与 A3B MoE,并覆盖多模态任务。
- 可信度:一手发布
- 意味着什么:多模态训练代码开源会降低企业理解模型工程的门槛。ABU9 不需要自己训练大模型,但可借鉴其数据管线、恢复训练、配置管理和多任务组织方式。
- 链接:https://x.com/SenseTime_AI/status/2059288013994406013
面壁智能开源 MiniCPM5-1B 端侧模型
- 事件:IT之家报道面壁智能开源 MiniCPM5-1B,称 INT4 后权重约 0.5GB,可在手机和浏览器运行,并开放权重、训练数据集与部署方案。
- 可信度:媒体报道
- 意味着什么:端侧小模型对车端、门店边缘设备、离线翻译和私有知识问答有现实意义。性能排名和 AA-Index 结论需用本地任务集复测。
- 链接:https://www.ithome.com/0/955/267.htm
腾讯混元发布 Hy-MT2 翻译模型和微信小程序
- 事件:腾讯混元官方称发布 Hy-MT2 翻译模型,1.8B 与 30B-A3B 版本开源,并上线微信小程序。
- 可信度:一手发布
- 意味着什么:翻译仍是企业 AI 低风险高频入口,尤其适用于跨国车企文档、售后资料和培训材料。榜单排名和下载量需要二次验证。
- 链接:https://x.com/TencentHunyuan/status/2059104921778352626
Google DeepMind 扩展 SynthID 水印合作
- 事件:Google DeepMind 官方称 SynthID 已为超过 1000 亿条内容添加水印,并与 OpenAI、ElevenLabs、Kakao 等合作。
- 可信度:一手发布
- 意味着什么:AI 内容溯源会进入平台合作阶段。汽车营销素材、门店短视频和培训内容生成后,应保留生成记录和水印策略,避免合规风险。
- 链接:https://x.com/GoogleDeepMind/status/2059235181274202500
Runway Project Luxo 称 AI 视频跨过“恐怖谷”
- 事件:Runway 发布 Project Luxo,展示 AI 短片与广告样片,认为观众开始关注故事而非技术瑕疵。
- 可信度:一手发布
- 意味着什么:这是官方研究和营销结合的材料,结论需谨慎。但方向明确:汽车销售短视频、活动预热视频、车型讲解会越来越自动化。
- 链接:https://runwayml.com/news/project-luxo
GPT-5.6 下月发布与 150 万 token 上下文传闻
- 事件:IT之家转述开发者从 Codex 后端日志发现未官宣 GPT-5.6 / iris-alpha,称可能支持 150 万 token 上下文。
- 可信度:待核实
- 意味着什么:未公开模型能力不能和正式发布同权重。可作为容量规划观察项,但当前方案仍应按已发布模型能力设计。
- 链接:https://www.ithome.com/0/955/078.htm
五、论文 / 研究 / 观点
Tom Tunguz:Agent Gravity 会成为平台竞争核心
- 观点:Agent 运行需要算力、数据、工具和工作负载,平台会争夺让 Agent 留在自己生态内。
- 意味着什么:企业不能只看单次调用价格,要看数据、工具、权限和运行历史被锁在哪个平台。ABU9 应保留模型路由和工具抽象层。
- 链接:https://www.tomtunguz.com/agent-gravity
Nathan Lambert:2026 年 5 月之后,开闭源平衡与权力博弈会加剧
- 观点:Interconnects 文章讨论 Gemini Flash 3.5、Mythos、美国开源力量增长和新兴权力博弈。
- 意味着什么:模型生态不会只有闭源 API 一条路。对中国企业 AI 落地,开源 / 私有化 / 商业 API 的组合会比单押某一家更稳。
- 链接:https://www.interconnects.ai/p/some-ideas-for-what-comes-next-may
Daytona 访谈:每个 Agent 都需要自己的“电脑”
- 观点:Ivan Burazin 把 Agent 视作数字知识工作者,复杂任务需要独立 sandbox、账号、权限和可终止的运行环境。
- 意味着什么:这与 OpenClaw 当前路线高度一致。企业 Agent 最小可行架构不是聊天框,而是受控机器 + 工具 + 凭证 + 审计。
- 链接:https://www.youtube.com/watch?v=kMXJrzAa5fM
Garry Tan:skill + eval + unit tests 才能让 Agent 能力留存
- 观点:Follow Builders 收录的原帖强调,用多个模型评估 skill 输入输出,并结合代码和单元测试持续改进。
- 意味着什么:OpenClaw skill 包不能只是提示词仓库,要有样例、评测、失败记录和质量门,才能形成复利。
- 原帖链接:https://x.com/garrytan/status/2059148823403082154
Aaron Levie:自动化不会消灭需求,只会抬高交付预期
- 观点:Levie 认为自动化通常让市场期待更多、更细、更定制的服务,而不是维持原交付物变便宜。
- 意味着什么:ABU9 用 AI 的目标不应只是降人天,而是把售前、实施、运维交付得更细、更快、更可追踪。
- 原帖链接:https://x.com/levie/status/2059025559896883489
六、今天值得读 / 值得看(BestBlogs / Follow Builders 精选)
Anthropic:How we contain Claude
- 为什么值得看:这是今天最值得内部转发的 Agent 安全文档,能直接转化为 OpenClaw 权限、沙箱、MCP 和网络出口设计清单。
- 链接:https://www.anthropic.com/engineering/how-we-contain-claude
PromptArmor:Microsoft Copilot Cowork exfiltrates files
- 为什么值得看:安全问题足够具体,适合作为“企业 Agent 上线前必须做文件权限测试”的反例材料。
- 链接:https://www.promptarmor.com/resources/microsoft-copilot-cowork-exfiltrates-files
Tom Tunguz:Agent Gravity
- 为什么值得看:把平台竞争讲成“Agent 工作负载迁移”的问题,适合判断云厂商、模型路由和数据平台的锁定风险。
- 链接:https://www.tomtunguz.com/agent-gravity
Daytona 访谈:Why AWS and Azure Cannot Run Autonomous AI
- 为什么值得看:访谈里对 sandbox、独立账号、2FA、权限限制的讨论,和 OpenClaw / Mac mini / 企业 Agent 的真实落地非常贴近。
- 链接:https://www.youtube.com/watch?v=kMXJrzAa5fM
Peter Yang:先搭系统再做 MVP
- 为什么值得看:核心观点是 AI agents 时代,文档、cron、skill file 和反馈系统从“过度工程”变成“高产出的前置条件”。
- 原帖链接:https://x.com/petergyang/status/2059029752858775581
Garry Tan:用多模型 eval 打磨 skill
- 为什么值得看:这条可以直接转成 OpenClaw skill 质量门:每个重要 skill 都要有输入输出样例、LLM-as-judge、单元测试和改进建议。
- 原帖链接:https://x.com/garrytan/status/2059148823403082154
Peter Steinberger:OpenClaw 依赖瘦身
- 为什么值得看:OpenClaw 将 Sharp/Jimp 换成更小的 Rust/WASM 图像处理依赖,提醒我们长期运行的 Agent 系统要持续控体积、控依赖、控冷启动。
- 原帖链接:https://x.com/steipete/status/2058922222790525272
Peter Steinberger:skill 描述要省 token
- 为什么值得看:skill 描述会进入上下文,冗长描述会直接影响选择准确率和成本;这对 ABU9 内部 skill 包建设是硬约束。
- 原帖链接:https://x.com/steipete/status/2058917897590673525
Nikunj Kothari:保持前沿只能持续动手
- 为什么值得看:观点不是鸡血,而是提醒 AI 领域先验几个月就会失效。ABU9 做 AI 产品要用小实验持续刷新判断。
- 原帖链接:https://x.com/nikunj/status/2058927145519562867
BestBlogs 今日数据降级说明
- 为什么值得看:今日 BestBlogs
public_today.data为空,未纳入正式精选;本栏目用 Follow Builders 的 builder / podcast / official signals 补足,避免无来源堆叠。 - 链接:https://bestblogs.dev
七、对我们有用的行动建议
给 OpenClaw 建一张 Agent 安全架构清单。 按 Anthropic 文章拆成 sandbox、VM / 主机边界、网络出口、MCP 权限、第三方内容、文件读写、日志审计,作为所有企业 demo 的默认附件。
把 ABU9 汽车业务拆成可执行 skill 包。 优先从售前方案、车型资料问答、维修工单解释、厂家系统查询、线索跟进、交付审计 6 个高频场景做样例。
做一个本地 Agent 可观测小工具验证。 参考 ccglass 思路,记录模型请求、token、工具调用、文件访问和外发链接,先用于内部 OpenClaw,再考虑客户化。
建立多模型路由和成本基线。 把 Qwen、DeepSeek、Kimi、MiniCPM、OpenRouter、OpenAI/Anthropic 放进同一组汽车任务集,按效果、延迟、成本、私有化难度评分。
把 artifact 交付质量产品化。 借鉴 design.md、beautiful-html-templates、FigMirror,把 ABU9 的报告、PPT、销售素材、培训图表做成模板 + 数据 + 评测的流水线。
八、今日结论
Agent 产业今天的主线不是“谁又发了更强模型”,而是生产级 Agent 需要自己的运行环境、安全边界、可观测性、成本路由和可复用 skill;这正是 OpenClaw 与 ABU9 能从 demo 走向企业交付的关键窗口。