Agent 正在从“聊天入口”迁移到“工作循环”。 Claude loops、Google ADK Go 2.0、Every 的复利工程都指向同一件事:下一阶段竞争不是单次回答质量,而是能否把计划、执行、审查、记忆和复用做成闭环。
今日重点项目雷达
Kulaxyz/self-learning-skills
是什么:面向 Claude Code、Cursor、AGENTS.md 的自学习 skill,把一次踩坑后的 golden path 采集成可复用规则。;判断标签:趋势增强。
Source ↗abundantbeing/hermes-browser-extension
是什么:浏览器侧边栏,把网页上下文连接到本地 Hermes agent runtime。;判断标签:趋势增强。
Source ↗cloudflare/security-audit-skill
是什么:面向 coding agent 的多阶段安全审计 skill,强调独立验证和机器可读发现。;判断标签:趋势增强。
Source ↗cobusgreyling/loop-engineering
是什么:AI coding agent 的 loop engineering 模式、starter 和 CLI,包含 loop-audit、loop-init、loop-cost。;判断标签:趋势增强。
Source ↗数据来源:AI HOT + GitHub 近期爆发项目 + BestBlogs 今日精选 + Follow Builders 建造者 feed + 必要核实。筛选标准:实时性、增速、AI/Agent 相关度、对 ABU9/OpenClaw 的启发。
一、今日主线判断
Agent 正在从“聊天入口”迁移到“工作循环”。 Claude loops、Google ADK Go 2.0、Every 的复利工程都指向同一件事:下一阶段竞争不是单次回答质量,而是能否把计划、执行、审查、记忆和复用做成闭环。
模型发布开始围绕“工具使用 + 长上下文 + 成本梯度”定价。 Claude Sonnet 5、LongCat-2.0、Gemini 图像/视频模型都在强调 agentic coding、1M 上下文或更低单价,说明企业 AI 架构需要默认支持多模型路由和任务分层。
GitHub 爆发项目集中在 skill、loop、browser harness、design artifact 和 memory。 今日高增项目不是泛 AI demo,而是围绕“让 coding agent 可复用、可审查、可沉淀”的基础设施,这与 OpenClaw 的长期方向高度一致。
AI 安全和评估正在变得更贴近真实工作场景。 OpenAI GeneBench-Pro、Anthropic Turn-Averaged SAE、Meta 未成年人危机提示测试都说明,行业开始从静态 benchmark 转向复杂任务、长对话、风险场景和可解释行为。
汽车与企业场景的机会在“可审计 agent 工作台”。 Claude Science 的 reviewer agent、ADK 的 HITL 编排、Cybercab 公路测试共同提示:ABU9 更应该做行业流程的可控 agent,而不是只做通用问答。
二、GitHub 近期爆发项目
Kulaxyz/self-learning-skills
- 是什么:面向 Claude Code、Cursor、AGENTS.md 的自学习 skill,把一次踩坑后的 golden path 采集成可复用规则。
- 元数据:创建 2026-06-28;stars 708;最近更新 2026-07-01;采集窗口/来源查询 new_7d_100 + new_14d_200_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:agent 工程的核心资产正在从 prompt 迁移到“可沉淀的技能包”;OpenClaw 应把失败复盘、质量门、客户交付流程都转成 skill。
- 链接:https://github.com/Kulaxyz/self-learning-skills
DietrichGebert/ponytail
- 是什么:用“懒惰高级工程师”策略约束 coding agent,强调少写代码、先降复杂度。
- 元数据:创建 2026-06-12;stars 70312;最近更新 2026-06-30;采集窗口/来源查询 new_30d_500_ai_agent + fresh_90d_active_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:高 star 可能存在传播放大,但方向有价值:企业内部 agent 不应只追求执行速度,还应被规则约束为“少改、少造、可解释”。
- 链接:https://github.com/DietrichGebert/ponytail
Waishnav/devspace
- 是什么:把 ChatGPT 变成类 Codex 的开发工作区。
- 元数据:创建 2026-06-14;stars 2757;最近更新 2026-07-01;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:新变量。
- 意味着什么:用户对“模型 + 文件系统 + 终端 + 任务上下文”的需求已经产品化,OpenClaw 的差异化应放在多会话、cron、消息入口和本地工具编排。
- 链接:https://github.com/Waishnav/devspace
abundantbeing/hermes-browser-extension
- 是什么:浏览器侧边栏,把网页上下文连接到本地 Hermes agent runtime。
- 元数据:创建 2026-06-24;stars 417;最近更新 2026-06-30;采集窗口/来源查询 new_7d_100 + new_14d_200_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:浏览器是企业知识和业务系统的真实入口;ABU9 的售前、CRM、DMS 辅助 agent 应优先考虑 browser-native 形态。
- 链接:https://github.com/abundantbeing/hermes-browser-extension
Forsy-AI/agent-apprenticeship
- 是什么:让 AI agent 在任务循环中积累工作经验,并把执行数据反哺未来任务。
- 元数据:创建 2026-06-19;stars 1132;最近更新 2026-06-24;采集窗口/来源查询 new_14d_200_ai_agent + new_30d_500_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:agent 的复利不在“多跑几次”,而在把每次执行变成数据、技能和评估;这正是 OpenClaw cron 与 Wiki 的结合点。
- 链接:https://github.com/Forsy-AI/agent-apprenticeship
vercel/eve
- 是什么:Vercel 推出的 agent 构建框架。
- 元数据:创建 2026-06-16;stars 3033;最近更新 2026-07-01;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:待验证。
- 意味着什么:重复出现次数较高,今日没有明确新增 release,暂不放大;但 Vercel 入场说明前端/部署平台会把 agent runtime 当成下一层云能力。
- 链接:https://github.com/vercel/eve
cloudflare/security-audit-skill
- 是什么:面向 coding agent 的多阶段安全审计 skill,强调独立验证和机器可读发现。
- 元数据:创建 2026-06-18;stars 2173;最近更新 2026-06-29;采集窗口/来源查询 new_14d_200_ai_agent + new_30d_500_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:企业 agent 交付必须内置审计动作,不然只能停留在个人效率工具;ABU9 做客户现场 AI 助手时要把审计结果结构化。
- 链接:https://github.com/cloudflare/security-audit-skill
safishamsi/graphify
- 是什么:把代码、数据库、脚本、文档、图片和视频转成可查询知识图谱的 coding assistant skill。
- 元数据:创建 2026-04-03;stars 75235;最近更新 2026-07-01;采集窗口/来源查询 fresh_90d_active_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:知识图谱正在成为 coding agent 的上下文压缩层;OpenClaw 应继续把 graphify-out 作为代码库问答和交付审计入口。
- 链接:https://github.com/safishamsi/graphify
cobusgreyling/loop-engineering
- 是什么:AI coding agent 的 loop engineering 模式、starter 和 CLI,包含 loop-audit、loop-init、loop-cost。
- 元数据:创建 2026-06-09;stars 4668;最近更新 2026-07-01;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:趋势增强。
- 意味着什么:loop 已经从概念变成工程对象;OpenClaw 的 cron/goal/session 可以沉淀为可复用 loop 模板。
- 链接:https://github.com/cobusgreyling/loop-engineering
inkeep/open-knowledge
- 是什么:AI-native markdown editor 和 LLM Wiki。
- 元数据:创建 2026-06-03;stars 1713;最近更新 2026-07-01;采集窗口/来源查询 new_30d_500_ai_agent。
- 判断标签:新变量。
- 意味着什么:知识库不再只是文档仓库,而是 agent 可检索、可更新、可验证的工作记忆;日报入库要保持 claim 级来源和复核条件。
- 链接:https://github.com/inkeep/open-knowledge
三、最近 7 天新项目:值得点开
TianhangZhuzth/Fundamental-Ava
- 是什么:构建可自治、可协作、具社会智能的数字人 agent。
- 元数据:创建 2026-06-30;stars 714;最近更新 2026-07-01;采集窗口/来源查询 new_7d_100 + new_14d_200_ai_agent。
- 判断标签:待验证。
- 意味着什么:描述中含代币式字符串,需先验证 README、代码质量和真实用途;数字人方向与展厅销售有关,但不能直接进入主线下注。
- 链接:https://github.com/TianhangZhuzth/Fundamental-Ava
yynxxxxx/Codex-5.5-codex-instruct-5.5
- 是什么:名称指向 Codex 相关模型/指令项目,但缺少描述。
- 元数据:创建 2026-06-28;stars 1002;最近更新 2026-07-01;采集窗口/来源查询 new_7d_100 + new_14d_200_ai_agent。
- 判断标签:噪音降权。
- 意味着什么:缺少描述且增长快,可能是蹭热点或异常传播;只作为“Codex 生态噪音升高”的信号,不纳入可用项目池。
- 链接:https://github.com/yynxxxxx/Codex-5.5-codex-instruct-5.5
Einsia/Browser-BC
- 是什么:面向浏览器使用的 agent 行为克隆和分布式轨迹采集。
- 元数据:创建 2026-06-26;stars 354;最近更新 2026-06-28;采集窗口/来源查询 new_7d_100。
- 判断标签:新变量。
- 意味着什么:浏览器轨迹数据会成为 Web agent 的训练和评估资产;对汽车经销商后台、售后系统自动化有参考价值。
- 链接:https://github.com/Einsia/Browser-BC
cclank/lanshu-animated-architecture-diagram
- 是什么:用于生成手绘风动画架构图的 Codex skill。
- 元数据:创建 2026-06-26;stars 403;最近更新 2026-06-26;采集窗口/来源查询 new_7d_100 + new_14d_200_ai_agent。
- 判断标签:新变量。
- 意味着什么:AI artifact 正从静态 HTML/PPT 走向可讲解动画;ABU9 售前方案、技术路线汇报可以实验“架构图自动动画化”。
- 链接:https://github.com/cclank/lanshu-animated-architecture-diagram
deepseek-ai/DeepSpec
- 是什么:训练和评估 speculative decoding 算法的全栈代码库。
- 元数据:创建 2026-06-26;stars 5734;最近更新 2026-07-01;采集窗口/来源查询 new_7d_100。
- 判断标签:待验证。
- 意味着什么:与 Agent 直接相关度低,但对推理成本和延迟优化有底层价值;可作为模型服务侧降本线索观察。
- 链接:https://github.com/deepseek-ai/DeepSpec
Pluviobyte/video-production-skills
- 是什么:可复用 AI 视频生产 skill 库,覆盖创作、复刻、动效、片头和 QA。
- 元数据:创建 2026-06-26;stars 492;最近更新 2026-06-30;采集窗口/来源查询 new_7d_100。
- 判断标签:待验证。
- 意味着什么:视频 artifact skill 正在增多,但重复出现次数较高,需看真实输出质量;若可用,可服务汽车展厅短视频和培训材料生产。
- 链接:https://github.com/Pluviobyte/video-production-skills
四、AI 热点新闻
Claude Sonnet 5 发布
- 事件:Anthropic 发布 Sonnet 5,强调计划、浏览器、终端工具使用和 autonomous run;官方 benchmark 与价格声明需待第三方验证。
- 可信度:一手发布。
- 意味着什么:OpenClaw 应把 Sonnet 5 纳入 agent loop 与 coding 任务的候选模型,但 benchmark 不应直接当采购依据。
- 链接:https://www.anthropic.com/news/claude-sonnet-5
Claude Science 科研工作台上线
- 事件:Anthropic 发布 Claude Science,提供 60+ 科研技能、连接器、本地/SSH/HPC 运行和 reviewer agent。
- 可信度:一手发布。
- 意味着什么:这是“垂直工作台 + skills + 审查 agent”的正式样板,ABU9 可借鉴到售前方案、车企知识工程、售后诊断。
- 链接:https://www.anthropic.com/news/claude-science-ai-workbench
Google ADK Go 2.0 发布
- 事件:Google 发布 ADK for Go 2.0,新增基于图的工作流引擎、HITL、动态执行和重试能力。
- 可信度:一手发布。
- 意味着什么:多 agent 编排正在进入强类型后端生态;企业项目要关注状态持久化、遥测和人工审批,而不是只连一个聊天窗口。
- 链接:https://developers.googleblog.com/announcing-adk-go-20
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash
- 事件:Google DeepMind 推出更低成本图像模型和视频生成/编辑模型 API。
- 可信度:一手发布。
- 意味着什么:多模态素材生产成本继续下降,汽车营销、展厅培训、售后说明视频可以进入“批量生成 + 人审”阶段。
- 链接:https://deepmind.google/blog/start-building-with-nano-banana-2-lite-and-gemini-omni-flash
美团 LongCat-2.0 旗舰模型发布
- 事件:硅基流动在 X 转述 LongCat-2.0,强调 1.6T MoE、1M 上下文、agentic coding 和低价。
- 可信度:X 传闻。
- 意味着什么:参数、价格、benchmark 不能与官方发布同权重;但国产模型在 coding agent 和长上下文上追赶很快,值得单独复核。
- 链接:https://x.com/SiliconFlowAI/status/2071831773076746715
X hosted MCP 进入讨论
- 事件:开发者称 X 推出 hosted X MCP,agent 可通过 MCP 直连 X API,按调用计费。
- 可信度:X 传闻。
- 意味着什么:实时社媒数据会成为 agent 的一等工具,但成本、权限和合规边界必须先测清楚;OpenClaw 可小额验证,不应默认接入生产。
- 链接:https://x.com/op7418/status/2071816099986022650
shot-scraper video 支持 agent 录制工作演示
- 事件:Simon Willison 介绍 shot-scraper 1.10 的 video 命令,可用 storyboard 和 Playwright 录制浏览器视频。
- 可信度:媒体报道。
- 意味着什么:端到端交付不只要代码跑通,还要自动生成演示证据;ABU9 项目可把“自动录屏验收”纳入交付质量门。
- 链接:https://simonwillison.net/2026/Jun/30/shot-scraper-video
Acti 把 AI agent 放入手机键盘
- 事件:TechCrunch 报道 Acti 发布 Gemini 驱动的 agent keyboard,并称获得 530 万美元种子轮融资。
- 可信度:媒体报道。
- 意味着什么:入口级 agent 会从 app 迁移到键盘、浏览器和系统层;融资与使用量数字需降权看待,但产品形态值得关注。
- 链接:https://techcrunch.com/2026/06/30/acti-puts-ai-agents-directly-into-your-smartphone-keyboard
Claude Desktop Linux 公测
- 事件:Claude Devs 在 X 宣布 Claude Desktop 支持 Ubuntu 和 Debian 测试版。
- 可信度:一手发布。
- 意味着什么:Linux 桌面补齐后,agent 工程师工作流更容易统一到本地桌面 + 终端 + MCP;对 OpenClaw 本地部署环境有利。
- 链接:https://x.com/ClaudeDevs/status/2071988881717871065
Cybercab 量产版在奥斯汀公开道路测试
- 事件:媒体报道特斯拉 Cybercab 在奥斯汀公共道路进行工程测试,车辆无方向盘和踏板。
- 可信度:媒体报道。
- 意味着什么:自动驾驶的真实进展仍在“工程测试 + 安全员 + 小规模车队”阶段;ABU9 应关注车企数字化服务,而不是盲目包装 L4 叙事。
- 链接:https://www.ithome.com/0/970/539.htm
Meta 被曝秘密测试竞品聊天机器人安全
- 事件:The Decoder 报道 Meta 承包商以未成年人视角向 ChatGPT、Gemini、Character.AI 发送危机提示。
- 可信度:媒体报道。
- 意味着什么:AI 安全测试会更接近真实风险场景,但竞品测试的合规边界会变敏感;企业 agent 也需要明确测试授权和数据边界。
- 链接:https://the-decoder.com/meta-secretly-tested-chatgpt-gemini-and-character-ai-with-thousands-of-minor-perspective-crisis-prompts
五、论文 / 研究 / 观点
OpenAI GeneBench-Pro
- 观点:OpenAI 用 129 个计算生物学问题评估 agent 在真实混乱数据、模糊性和判断性分析中的能力。
- 意味着什么:企业 AI 评测也应从“答对题”转向“处理真实资料、选择路径、留下审计轨迹”。
- 链接:https://openai.com/index/introducing-genebench-pro
Anthropic Turn-Averaged SAE
- 观点:Anthropic 提出对每个对话回合取平均后训练 SAE,以更少特征观察高层模型行为。
- 意味着什么:长对话 agent 的安全和质量监控需要回合级信号;OpenClaw 未来可记录 task-level 行为特征,而非只记录 token。
- 链接:https://transformer-circuits.pub/2026/june-update/index.html
Claude Code 智能体循环
- 观点:Claude Blog 把 agent loop 分成 turn-based、goal-based、time-based、proactive,并强调把验证步骤写入 SKILL.md。
- 意味着什么:这与 OpenClaw cron、goal、skill 的组合高度同构;下一步应把日报、行业监控、项目审计都做成可验证 loop。
- 链接:https://claude.com/blog/getting-started-with-loops
Every 的复利工程
- 观点:Every 的单人工程团队把 Plan、Work、Review、Compound 做成循环,把解法写回 CLAUDE.md 和 docs/solutions。
- 意味着什么:80% 时间用于计划和审查,不是低效,而是在给 agent 构造可复用环境;ABU9 的 AI 转型也应先做流程资产化。
- 链接:https://x.com/xiaohu/status/2071796715162857477
专业化为何不可避免
- 观点:Hugging Face 文章从优化理论、生物学和市场竞争说明,有限资源下专门化系统会胜过泛化系统。
- 意味着什么:ABU9 不应做“通用企业大模型平台”,应做汽车行业流程、知识、审计和交付场景的专业化 agent。
- 链接:https://huggingface.co/blog/Dharma-AI/why-specialization-is-inevitable
六、今天值得读 / 值得看(BestBlogs / Follow Builders 精选)
Claude Code 入门:智能体循环
- 为什么值得看:这是官方把 loops 明确定义成工程模式的文章,直接影响 OpenClaw 的 cron、goal、skill 设计。
- 链接:https://claude.com/blog/getting-started-with-loops
Claude Science AI Workbench
- 为什么值得看:垂直工作台、技能包、连接器、reviewer agent 的组合,是企业行业 agent 的参考架构。
- 链接:https://www.anthropic.com/news/claude-science-ai-workbench
ADK Go 2.0
- 为什么值得看:Google 把多 agent 图工作流、HITL、重试和状态统一进 Go runtime,适合企业后端团队评估。
- 链接:https://developers.googleblog.com/announcing-adk-go-20
shot-scraper video
- 为什么值得看:让 agent 自动录制工作演示,是交付验收和异步协作的低成本证据链。
- 链接:https://simonwillison.net/2026/Jun/30/shot-scraper-video
OpenAI GeneBench-Pro
- 为什么值得看:它不是单题 benchmark,而是让 agent 在真实 messy 数据中做判断,适合借鉴到车企业务评测。
- 链接:https://openai.com/index/introducing-genebench-pro
Grant Sanderson 谈 AI 与数学未来
- 为什么值得看:提醒不要把一个 benchmark 的突破等同 AGI,适合校准内部对模型能力的预期。
- 链接:https://www.dwarkesh.com/p/grant-sanderson-2
Follow Builders:Boris Cherny 关于 Claude Desktop Linux
标题/核心观点:Claude Desktop on Linux is here。
- 为什么值得看:Claude 工具链在 Linux 桌面补齐,对本地 agent 开发者生态是实用增量。
- 原帖链接:https://x.com/bcherny/status/2072000214634742243
Follow Builders:Nan Yu 关于“distillation”定义
标题/核心观点:训练数据、蒸馏和模型生态边界会越来越模糊。
- 为什么值得看:模型能力迁移与数据合规会影响企业采购、私有化和二次训练策略。
- 原帖链接:https://x.com/thenanyu/status/2071973229070033322
Follow Builders:Madhu Guru 关于 AI-native PM
标题/核心观点:传统 PM 的约束优先思维不适配 AI-native building。
- 为什么值得看:对 ABU9 AI 产品转型有提醒:不要用传统功能清单约束 agent 产品,先从未来体验倒推。
- 原帖链接:https://x.com/realmadhuguru/status/2071970221477470694
七、对我们有用的行动建议
把 OpenClaw 的日报链路产品化成 loop 模板。 标准包含采集、筛选、质量门、HTML 发布、Wiki claim 入库、降级说明;这本身就是可复用的企业情报 agent 样板。
ABU9 先做“汽车行业 Skill 包”,不要先做大平台。 目标场景:售前方案、DMS/CRM 操作辅助、售后知识问答、项目交付审计、车企培训内容生成。
给每个企业 agent 加 reviewer agent 和证据链。 借鉴 Claude Science 与 shot-scraper video,输出不只是一段答案,而是引用、操作记录、录屏/截图、复核条件。
建立多模型路由和成本观测。 Sonnet 5、LongCat、Gemini 多模态都在改变价格/能力曲线;OpenClaw 应按任务类型记录模型、成本、成功率和人工返工率。
GitHub 项目跟踪要保留“噪音降权”层。 今天 Codex 模型蹭热点、代币式数字人、低相关高 star 项目不少;不要让 star 数替代工程判断。
八、今日结论
AI 世界今天的主线不是“又出了几个模型”,而是 agent 正在变成可循环、可审计、可沉淀的工作系统;OpenClaw 和 ABU9 的机会在把行业流程做成专业化 agent,而不是追逐泛化 demo。
降级说明
- BestBlogs:采集脚本返回
success=true但data=null,今日“值得读 / 值得看”由 Follow Builders 与 AI HOT 高信号源补位,未硬凑 BestBlogs 条目。 - GitHub API:采集成功,已优先使用
github.ranked_recent,并对缺描述、低相关、重复出现项目做了待验证或噪音降权。 - AI HOT:采集成功;融资、benchmark、未公开模型能力和 X 爆料均按可信度降权。
- Telegram 正文输出:本次通过 cron final 直接返回全文;如通道截断,以 HTML 版为准。
- Wiki 写入、HTML 发布和质量门状态:见执行结果;若失败会在最终回复中补充 blocker。