今日重点项目雷达
benchflow-ai/awesome-evals
判断标签:新变量;意味着什么:Agent 从 demo 进入生产后,评估资源会变成基础设施。ABU9 的销售助手、车间助手也需要“任务级 eval”,不能只看问答样例。
Source ↗amplifthq/opentag
判断标签:新变量;意味着什么:@agent 提及、Slack/GitHub 线程回写、Codex/Claude Code 路由,是企业 Agent 接入真实协作流的方向。OpenClaw 可以借鉴“窄工具 + 回写线程 + 可审计结果”。
QwenLM/Qwen-AgentWorld
判断标签:趋势增强;意味着什么:通义系继续补 agent 训练/评测路线。对 ABU9 来说,国产模型不只是降级备选,也可能在行业场景和本地化合规上成为主力。
Source ↗DietrichGebert/ponytail
判断标签:趋势增强,但重复降权;意味着什么:它不是底层技术突破,而是 Coding Agent 约束哲学的爆款包装。“少写代码、少造复杂度”适合沉淀为 OpenClaw 开发类 skill 的质量原则。
Source ↗krea-ai/krea-2
判断标签:待验证;意味着什么:视觉生成模型继续开源推理代码,适合关注内容资产和营销物料生产,但与 ABU9 核心 Agent 运行时弱相关,放二级观察。
Source ↗nexu-io/html-video
判断标签:趋势增强;意味着什么:HTML 到视频可以接入日报、客户案例、销售培训短片流水线。OpenClaw 的 artifact pipeline 可把 HTML/PPT/视频视为同一交付链路。
Source ↗winsznx/theeleven
判断标签:高热但降权;意味着什么:自主 agent + 链上足球预测市场,叙事强、企业 AI 相关度低。按新规则不进入主线,只作为 agent 叙事外溢观察。
Source ↗helloianneo/ian-xiaohei-illustrations
判断标签:可复用资产;意味着什么:配图 skill 的细分模板化明显,适合 ABU9 做行业案例图、公众号配图、活动物料,但要注意版权和品牌一致性。
Source ↗omnigent-ai/omnigent
判断标签:持续跟踪;意味着什么:多 harness/meta-agent 方向与 OpenClaw 相关,但已连续出现,今天只保留索引,不重复占正文。
Source ↗数据来源:AIHOT 过去 24 小时精选 + GitHub 近期爆发项目 + Follow Builders feed + 一手源回查。
新筛选规则:先按
source_tier分层,再做事件聚类;模型/Agent 只做维度判断,最终入选按“来源权威性 + 新鲜度 + ABU9/OpenClaw 相关度 + 可行动性 - 重复/噪音惩罚”决策。采集时间:2026-06-27 05:50 Asia/Shanghai。
一、今日主线判断
- 前沿模型发布进入准入制。 OpenAI GPT-5.6 的核心信号不是“又强了”,而是官方确认有限预览来自与美国政府沟通及其请求;模型供应链风险已经从技术问题变成采购和合规问题。
来源层级:T1_official;主源:https://openai.com/index/previewing-gpt-5-6-sol/
- 日报生产应从写作流升级为情报 pipeline。 AIHOT 复盘证明:信源分层、事件聚类、模型维度评分、代码公式排序,比让模型自由判断“值不值得看”更可靠。
来源层级:T2_expert_builder;主源:https://mp.weixin.qq.com/s/r6CE2U3Y0-pU05wF3_PuTQ
- Agent 工程化继续围绕“可评估、可路由、可回写”推进。 Awesome evals、OpenTag、Qwen-AgentWorld、Claude/Next.js 相关 builder 信号都指向同一件事:Agent 不再只是调用工具,而要有评估、线程回写、权限和任务协议。
来源层级:T1_project_repo + T2_expert_builder
- AI 合规风险从训练数据延伸到基础设施责任。 纽约时报对微软/OpenAI 诉讼的修订,重点不只是版权,而是把“为训练建造和运营超算”也纳入帮助侵权叙事;企业 AI 内容来源和授权链要开始被当资产管理。
来源层级:T2_media;主源:https://arstechnica.com/tech-policy/2026/06/microsoft-built-supercomputer-to-help-openai-infringe-copyrights-nyt-alleged
- 企业 AI 选型要回到结果而非模型崇拜。 Anthropic Economic Index、AI 经济收入报告、OpenAI/Claude 新模型都说明需求是真的,但生产价值仍要看任务闭环、成本、错误率、人工接管和可审计性。
来源层级:T1_official + T2_media + T2_expert_builder
二、GitHub 近期爆发项目
benchflow-ai/awesome-evals
- source_tier:
T1_project_repo - 事件簇:agent-eval-resource
- 元数据:创建 2026-06-24;stars 451;最近更新 2026-06-26;repeat_count_7d=1;reason_flags=
new_7d,high_velocity,recently_updated - 判断标签:新变量
- 意味着什么:Agent 从 demo 进入生产后,评估资源会变成基础设施。ABU9 的销售助手、车间助手也需要“任务级 eval”,不能只看问答样例。
- 链接:https://github.com/benchflow-ai/awesome-evals
amplifthq/opentag
- source_tier:
T1_project_repo - 事件簇:agent-thread-routing
- 元数据:创建 2026-06-24;stars 约 200+;最近更新 2026-06-26;repeat_count_7d=0;reason_flags=
new_7d,high_velocity,recently_updated - 判断标签:新变量
- 意味着什么:
@agent提及、Slack/GitHub 线程回写、Codex/Claude Code 路由,是企业 Agent 接入真实协作流的方向。OpenClaw 可以借鉴“窄工具 + 回写线程 + 可审计结果”。 - 链接:https://github.com/amplifthq/opentag
QwenLM/Qwen-AgentWorld
- source_tier:
T1_project_repo - 事件簇:agent-world-model
- 元数据:创建 2026-06-22;stars 561;最近更新 2026-06-25;repeat_count_7d=2;reason_flags=
new_7d,high_velocity,recently_updated - 判断标签:趋势增强
- 意味着什么:通义系继续补 agent 训练/评测路线。对 ABU9 来说,国产模型不只是降级备选,也可能在行业场景和本地化合规上成为主力。
- 链接:https://github.com/QwenLM/Qwen-AgentWorld
DietrichGebert/ponytail
- source_tier:
T1_project_repo - 事件簇:coding-agent-constraint-skill
- 元数据:创建 2026-06-12;stars 59,924;最近更新 2026-06-26;repeat_count_7d=2;reason_flags=
new_14d,high_velocity,recently_updated - 判断标签:趋势增强,但重复降权
- 意味着什么:它不是底层技术突破,而是 Coding Agent 约束哲学的爆款包装。“少写代码、少造复杂度”适合沉淀为 OpenClaw 开发类 skill 的质量原则。
- 链接:https://github.com/DietrichGebert/ponytail
krea-ai/krea-2
- source_tier:
T1_project_repo - 事件簇:visual-generation-open-inference
- 元数据:创建 2026-06-22;最近更新 2026-06-24;repeat_count_7d=0;reason_flags=
new_7d,recently_updated - 判断标签:待验证
- 意味着什么:视觉生成模型继续开源推理代码,适合关注内容资产和营销物料生产,但与 ABU9 核心 Agent 运行时弱相关,放二级观察。
- 链接:https://github.com/krea-ai/krea-2
nexu-io/html-video
- source_tier:
T1_project_repo - 事件簇:artifact-to-video-pipeline
- 元数据:创建 2026-05-27;stars 3,562;最近更新 2026-06-21;repeat_count_7d=0;reason_flags=
new_30d,high_velocity - 判断标签:趋势增强
- 意味着什么:HTML 到视频可以接入日报、客户案例、销售培训短片流水线。OpenClaw 的 artifact pipeline 可把 HTML/PPT/视频视为同一交付链路。
- 链接:https://github.com/nexu-io/html-video
三、最近 7 天新项目:值得点开
winsznx/theeleven
- source_tier:
T1_project_repo - 元数据:创建 2026-06-25;stars 472;最近更新 2026-06-25;repeat_count_7d=0
- 判断标签:高热但降权
- 意味着什么:自主 agent + 链上足球预测市场,叙事强、企业 AI 相关度低。按新规则不进入主线,只作为 agent 叙事外溢观察。
- 链接:https://github.com/winsznx/theeleven
helloianneo/ian-xiaohei-illustrations
- source_tier:
T1_project_repo - 元数据:创建 2026-05-27;最近更新 2026-06-03;repeat_count_7d=0
- 判断标签:可复用资产
- 意味着什么:配图 skill 的细分模板化明显,适合 ABU9 做行业案例图、公众号配图、活动物料,但要注意版权和品牌一致性。
- 链接:https://github.com/helloianneo/ian-xiaohei-illustrations
bozhouDev/codex-orange-book
- source_tier:
T1_project_repo - 元数据:创建 2026-06-23;stars 2,125;repeat_count_7d=3;reason_flags=
repeat_downgrade - 判断标签:重复降权
- 意味着什么:中文 Codex 使用热度继续高,但今天没有新增事实。按新规则不再主榜重复展开。
- 链接:https://github.com/bozhouDev/codex-orange-book
omnigent-ai/omnigent
- source_tier:
T1_project_repo - 元数据:创建 2026-06-11;最近更新 2026-06-26;repeat_count_7d=3;reason_flags=
repeat_downgrade - 判断标签:持续跟踪
- 意味着什么:多 harness/meta-agent 方向与 OpenClaw 相关,但已连续出现,今天只保留索引,不重复占正文。
- 链接:https://github.com/omnigent-ai/omnigent
四、AI 热点新闻
GPT-5.6 Sol/Terra/Luna 有限预览
- source_tier:
T1_official - 可信度:一手发布
- 事件聚类:合并 OpenAI 官方页、X/媒体转述;主条取官方页。
- 事件:OpenAI 预览 GPT-5.6 系列,Sol 作为旗舰模型,Terra 面向日常工作,Luna 面向低成本快速任务;初期仅开放给少量 trusted partners。
- 意味着什么:模型能力强弱之外,更关键的是发布准入、客户资格和供应链可用性。ABU9/OpenClaw 必须默认多模型路由。
- 链接:https://openai.com/index/previewing-gpt-5-6-sol/
Anthropic Economic Index 更新
- source_tier:
T1_official - 可信度:一手发布
- 事件:Anthropic 发布 Economic Index 使用节奏相关报告。
- 意味着什么:企业 AI 的真实价值要从使用结构和任务迁移观察,而不是只看模型发布。适合作为 ABU9 做 AI ROI 叙事的一手材料。
- 链接:https://www.anthropic.com/research/economic-index-june-2026-report
Claude 接入 Apple Foundation Models 框架
- source_tier:
T1_official - 可信度:一手发布
- 事件:Claude 官方博客讨论在 Apple 平台 Foundation Models framework 上构建智能应用。
- 意味着什么:端侧框架 + 云端模型的组合会成为企业移动端 AI 的默认形态。销售顾问、售后顾问的手机端助手不能只做网页聊天框。
- 链接:https://claude.com/blog/claude-for-foundation-models
纽约时报修订对微软/OpenAI 诉讼
- source_tier:
T2_media - 可信度:媒体报道
- 事件聚类:合并 Ars Technica 与中文媒体转述;主条取 Ars Technica。
- 事件:报道称纽约时报修订诉讼,指控微软为 OpenAI 建造用于版权侵权训练的超算基础设施。
- 意味着什么:内容合规责任可能从“谁训练模型”扩展到“谁提供训练基础设施”。企业知识库、训练数据、RAG 引用必须保留来源和授权边界。
- 链接:https://arstechnica.com/tech-policy/2026/06/microsoft-built-supercomputer-to-help-openai-infringe-copyrights-nyt-alleged
近 400 家美国报纸起诉微软和 OpenAI
- source_tier:
T2_media - 可信度:媒体报道
- 事件:中文媒体报道出版商联盟起诉微软和 OpenAI 未授权抓取新闻内容。
- 意味着什么:与上条属于同一合规大事件簇,日报只保留补充,不重复推导。
- 链接:https://www.ithome.com/0/968/872.htm
小鹏称 2026 年底自动驾驶可合法进入全球
- source_tier:
T2_media - 可信度:媒体报道
- 事件:何小鹏谈 2026 年底自动驾驶合法进入全球的判断。
- 意味着什么:车端智能和监管叙事升温,会反向影响经销商/售后系统对“AI 解释、审计、接管”的要求。ABU9 应关注合规叙事如何进入车企数字化方案。
- 链接:https://www.ithome.com/0/968/894.htm
AI 聊天机器人政治倾向测试扩散
- source_tier:
T2_media/T2_expert_builder - 可信度:媒体报道
- 事件:Rohan Paul 转发华盛顿邮报关于 AI 聊天机器人左翼偏见的报告。
- 意味着什么:企业 AI 面向客户时,默认回答风格、价值判断和敏感议题边界需要可配置。汽车销售/售后助手要避免被卷入无关价值判断。
- 链接:https://x.com/rohanpaul_ai/status/2070550479621488896
Leaf 实时通话 AI 分身工程拆解
- source_tier:
T2_expert_builder - 可信度:X 一手项目/待复核
- 事件:AI Notes 分享 Leaf 将网红峰哥做成实时通话 AI 分身的开源项目。
- 意味着什么:对 ABU9 的价值不在复刻网红,而在 ASR/LLM/TTS/persona 的低延迟链路,可映射到智能销售助理语音版。
- 链接:https://x.com/AYi_AInotes/status/2070531964067623381
五、论文 / 研究 / 观点
Anthropic Economic Index:从“AI 能做什么”转到“人怎么用 AI”
- 判断:企业 AI 投资要看使用节奏、任务迁移和真实工作流,而不是模型能力单点指标。
- 链接:https://www.anthropic.com/research/economic-index-june-2026-report
AIHOT 复盘:能用代码控制的,不交给模型
- 判断:模型评分适合做语义理解和维度判断,最终决策应由可回测的规则系统完成。日报、竞品监控、客户舆情都适用。
- 链接:https://mp.weixin.qq.com/s/r6CE2U3Y0-pU05wF3_PuTQ
Next.js 错误页加入 Copy prompt
- 判断:软件正在主动为 agent 生成上下文。企业系统的错误页、日志页、工单页也应变成 agent-readable。
- 原帖链接:https://x.com/rauchg/status/2070243120546218000
把设计标准注入 coding agents
- 判断:设计系统会从 Figma/文档变成模型可执行约束。ABU9 的行业组件、表单规则、交付格式也应 skill 化。
- 原帖链接:https://x.com/rauchg/status/2070241572416078161
六、今天值得读 / 值得看
标题/核心观点:AIHOT 开放与情报筛选系统复盘
为什么值得看:这是今天对我们日报最有直接改造价值的文章。
标题/核心观点:Peter Yang 让 Codex 用浏览器规划日本旅行
为什么值得看:浏览器 Agent 已能做个人长流程任务,可映射到经销商网页巡检、竞品价格监控、售后流程核验。
标题/核心观点:Aaron Levie 讨论模型发布的事实监管
为什么值得看:解释为什么 GPT-5.6 这种发布节奏会改变企业模型采购风险。
标题/核心观点:Claude Code Hook 玩法
为什么值得看:Hook 不耗 token,适合把提醒、归档、质量门、推送放进 agent runtime。
标题/核心观点:小互 IP Studio 配图 skill
为什么值得看:内容资产生产 skill 化,适合 ABU9 客户案例图、活动海报、公众号封面。
标题/核心观点:Cloudflare CEO 播客:Bot、Edge AI 与 CEO 决策
为什么值得看:边缘 AI 和 bot 经济会影响企业网站、内容、身份与流量治理。
七、对我们有用的行动建议
- 日报 pipeline 改造:把
source_tier / cluster_id / main_source_url / related_urls / risk_flags / rule_final_score加进采集 JSON,先从 AIHOT + GitHub + Follow Builders 三类源做。 - ABU9 方案话术:对客户讲 AI 不要只讲模型能力,要讲“来源可追溯、可信度标注、事件去重、质量门、人工接管”。
- OpenClaw runtime:参考 OpenTag,把任务结果回写到原线程;参考 Hook,把日报质量门、发布校验、Wiki 入库变成自动规则。
- 模型选型:GPT-5.6 Sol 暂作上限模型观察;企业生产默认保留 Claude/国产/开源降级,不让模型准入影响交付承诺。
- 内容资产:把日报、客户案例、销售物料、培训视频都纳入 artifact pipeline,HTML/PPT/图片/视频互相转化。
八、今日结论
今天最重要的不是某个模型更强,而是 AI 生产系统正在变得可治理:模型负责理解,规则负责筛选,来源负责可信,运行时负责审计。OpenClaw 和 ABU9 应该把这套治理能力做成默认底座。
九、筛选治理试运行说明
- source_tier 分布:热点新闻主条中
T1/T1.5/T2_expert占 5/8,未达到目标 70%,原因是 AIHOT 过去 24 小时精选中 T2 媒体较多;已做事件聚类和降权说明。 - 事件聚类:OpenAI GPT-5.6、微软/OpenAI 版权诉讼、Codex/agent 工作流信号均做了合并,避免重复展开。
- 降权案例:
winsznx/theeleven高热但 ABU9/OpenClaw 相关度低;bozhouDev/codex-orange-book与omnigent-ai/omnigent因 7 日重复次数高降权。 - 降级项:采集脚本里的 AIHOT/BestBlogs 自动字段为空;已按 AIHOT skill 直接调用公开 API 补取 24 小时精选。BestBlogs 本轮仍未使用。
- 质量门:章节齐全;链接数 > 20;X 条目保留原帖链接;可信度标签已标注;Wiki 入库本试运行暂不执行,避免污染正式日报知识库。