# Obscura 真实信源实验报告

日期：2026-07-16  
版本：Obscura v0.1.10，macOS ARM64

## 结论

当前不接入生产链路，也不作为统一信源系统的默认 JS 抓取器。保留观察，待后续版本再复测。

Obscura 对普通公开页面可以提取干净文本，但本次没有救回任何一个 HTTP 采集失败的真实信源；20 个样本总耗时约为 curl 的 5 倍。它的价值主要是低依赖、直接输出正文和 CDP/MCP 接口，不是提升当前信源覆盖率。

## 样本

20 个公开页面，覆盖：

- 技术博客与静态站点：Simon Willison、Hacker News。
- AI/代码：GitHub、Anthropic、Thinking Machines、LMSYS。
- 科技媒体：TechCrunch、The Verge。
- 汽车行业：盖世汽车、CDK Global、Cox Automotive、CADA、ZKJ。
- 近期降级源：AutoLab、CAAM、车东西 Feed。
- 动态或受限页面：QuickRead、微信公众号、X Article。

## 结果

- Obscura 获得可用正文：15/20。
- 普通 HTTP 获得可用响应：15/20；另有 2 个“响应成功但内容不可直接使用”的假阳性（车东西 500 错误页、X 登录壳）。
- Obscura 独有成功：0。
- 两者均失败：AutoLab HTTPS、CAAM HTTPS、微信公众号。
- Obscura 失败但普通 HTTP 有响应：车东西 Feed、X Article；这些响应本身仍需错误页识别或专用 API。
- 20 个样本总耗时：Obscura 136.0 秒；curl 27.4 秒，Obscura 约慢 4.96 倍。
- Anthropic 单页实测：Obscura 13.55 秒、最大 RSS 93.2 MB；curl 2.51 秒、最大 RSS 6.9 MB。

## 补充验证

- AutoLab HTTP：Obscura 可提取 3,776 字节正文，但现有汽车日报已经具备 HTTPS → HTTP 降级，因此没有新增价值。
- CAAM HTTP：Obscura 30 秒硬超时，未解决现有问题。
- 车东西首页：Obscura 可提取 4,579 字节正文，但不能修复 Feed 500；可作为页面抓取备选，现有网页 fallback 已能承担。
- X Article：Obscura 只能拿到页面壳，无法得到文章正文；FxTwitter API 能直接返回结构化全文，专用适配器更合适。

## 价值判断

- 提升覆盖率：低。本轮新增成功为 0。
- 降低成本：未验证成立。macOS 单次进程峰值约 93 MB，明显高于官方首页的笼统宣传值，也高于普通 HTTP。
- 提升文本可用性：中。`--dump text` 输出干净，适合没有现成正文解析器的临时任务。
- 替代 Chrome：低。复杂 SPA、微信、X 等关键难点没有解决。
- 接入维护成本：中。需要新增二进制供应链管理、版本回归、错误页识别和 Chrome fallback。

## 决策

统一信源系统采用按来源选择专用适配器的策略：

1. RSS/Atom 和静态网页优先普通 HTTP + 正文解析。
2. X 使用结构化第三方/官方接口，并保留浏览器兜底。
3. 微信和登录态页面使用真实隔离浏览器。
4. 汽车站点继续 HTTPS → HTTP → 专业页面 fallback。
5. Obscura 暂列实验性适配器，不进入自动路由。

满足以下任一条件时复测：

- 发布 0.2 稳定版并明显扩大 Web API/CDP 兼容覆盖；
- 当前 Chrome 批量任务出现明确内存瓶颈；
- 出现一批普通 HTTP 无正文、Obscura 可稳定提取的真实信源。

## 复现资料

- 原始结果：`/tmp/obscura-eval/results.tsv`
- 实验脚本：`/tmp/obscura-eval/benchmark.py`
- 下载包 SHA-256：`a4a868cedf2fb95f2b3af2dc9dacf235eef08398f070387b9a02e65faf1f93e3`

