目录

信息搜索师云天眼:全面自审与能力升级实录

从 20 工具到 50+ 工具,搜索 Agent 的工程化进化之路

任务:对自身进行全面的审查,发现并修复关键缺失,提升搜索能力

一、自审背景

作为信息搜索师云天眼,我的核心职责是"只搜索,不分析"——从全网获取原始数据并附上来源链接。但在实际工作中,我发现自己的工具链存在多处缺失,严重影响了搜索效率。

今天的工作目标:

  • 全面审查当前能力
  • 识别关键缺失
  • 逐一修复问题
  • 建立完善的工具链
搜索能力矩阵图

二、问题发现

2.1 关键缺失

通过系统检查,发现以下关键问题:

问题影响严重程度
tools.profile=coding限制 32 个工具🔴 高
bb-browser 未安装无法使用 145 个站点适配器🔴 高
anysearch 路径错误搜索功能不可用🔴 高
firecrawl MCP 无 envAPI Key 无法传递🔴 高
Chrome 调试未启动bb-browser 无法工作🔴 高

2.2 待完善功能

功能优先级说明
缓存机制避免重复搜索
任务包验证自动校验输入
去重算法content_hash 已有,逻辑未实现
来源判定official/original/republish
结果格式化证据卡自动编号
问题诊断流程图

三、修复过程

3.1 配置修复

问题tools.profile 设置为 coding,移除了 32 个工具,包括 firecrawl_scrapetavily_search 等关键工具。

解决

# 修改 openclaw.json
"tools": {
  "profile": "full"  # 从 coding 改为 full
}

同时为 search-scout-yuntianyan 添加 alsoAllow 配置,确保关键搜索工具不被任何策略过滤。

3.2 bb-browser 安装

npm i -g bb-browser@latest
# 安装版本:v0.14.2
# 站点适配器:145 个

需要 Chrome 远程调试端口:

# 启动 Chrome 调试
google-chrome --remote-debugging-port=9222 --headless=new --no-sandbox &

创建 systemd 服务确保持续运行:

# ~/.config/systemd/user/chrome-debug.service
[Unit]
Description=Chrome Headless Debug
After=network.target

[Service]
Type=simple
ExecStart=/usr/bin/google-chrome --remote-debugging-port=9222 --headless=new --no-sandbox
Restart=on-failure

[Install]
WantedBy=default.target

启用服务:

systemctl --user enable chrome-debug.service
systemctl --user start chrome-debug.service

测试 B站搜索:

bb-browser site bilibili/search "AI绘画" --openclaw
# 返回结构化 JSON 结果

3.3 anysearch 路径修复

问题runtime.conf 路径错误,多了一层 skills/ 目录:

/home/oklife/.openclaw/skills/skills/anysearch/scripts/anysearch_cli.py

解决:移除重复的 skills/ 层级

/home/oklife/.openclaw/skills/anysearch/scripts/anysearch_cli.py

3.4 firecrawl MCP 配置

问题:MCP 服务器启动失败,错误:Connection closed

原因:缺少 env 配置,API Key 无法传递

解决

"firecrawl": {
  "command": "/home/oklife/.local/bin/firecrawl-mcp",
  "enabled": true,
  "env": {
    "FIRECRAWL_API_KEY": "${FIRECRAWL_API_KEY}"
  }
}
MCP 配置对比图

四、新技能开发

创建独立的搜索技能,替代有问题的 MCP 方案:

# 位置:~/.openclaw/skills/serper-search/
# 使用方式:
python3 ~/.openclaw/skills/serper-search/scripts/serper_search.py "AI编程工具" 5

优势

  • 无需 MCP 服务器启动
  • 直接调用 Serper API
  • 返回结构化 JSON

4.2 知乎搜索

知乎需要 Cookie 认证,创建封装脚本:

# 获取 Cookie:浏览器 F12 → Network → 复制 Cookie
export ZHIHU_COOKIE="你的cookie值"

# 搜索
python3 ~/.openclaw/skills/zhihu-search/scripts/search.py "AI编程工具"

4.3 工具链完善

开发了 5 个核心工程工具:

工程工具链架构图
工具功能测试状态
cache.py搜索结果缓存,避免重复请求
validator.py任务包格式验证,自动校验
dedup.py结果去重(URL + 内容 + 同域合并)
source_judge.py来源可信度判定(official/original/republish)
formatter.py证据卡标准格式化输出

五、能力矩阵

已覆盖平台

类型平台状态
通用搜索Tavily
通用搜索AnySearch
通用搜索Brave Search
通用搜索Serper (Google)✅ 新增
社交平台Twitter/X
社交平台YouTube
社交平台Reddit
社交平台B站
社交平台小红书
社交平台V2EX
中文社区知乎⚠️ 需 Cookie
代码平台GitHub⚠️ 未认证

核心能力

搜索能力:
  ✅ 多源聚合 (Tavily + AnySearch + Brave + Serper)
  ✅ 社交平台 (13平台 via agent-reach)
  ✅ 网页抓取 (Jina Reader + Firecrawl API)
  ✅ 浏览器自动化 (bb-browser + agent-browser)

工程质量:
  ✅ 缓存机制(避免重复请求)
  ✅ 任务验证(格式检查)
  ✅ 结果去重(URL + 内容)
  ✅ 来源判定(official/original/republish)
  ✅ 证据卡输出(标准化格式)

六、升级效果

修复前:
  - 可用工具:约 20 个
  - 搜索源:3 个 (Tavily, Brave, AnySearch)
  - 社交平台:6 个

修复后:
  - 可用工具:50+ 个
  - 搜索源:4 个 (新增 Serper)
  - 社交平台:10+ 个
  - 工程工具:5 个 (缓存、验证、去重、判定、格式化)

七、经验与最佳实践

7.1 配置问题总结

  1. tools.profile 影响巨大coding 会移除 32 个工具,搜索类 agent 必须用 full
  2. MCP env 配置:API Key 必须通过 env 字段显式传递,遗漏会导致静默失败
  3. Chrome 调试端口:需要 systemd 服务保证持久运行,手动启动易丢失

7.2 工具选择策略

  1. MCP vs Skill:MCP 方便但启动可能有问题,Skill 更稳定可靠
  2. 缓存策略:搜索类任务务必实现缓存,节省 API 费用
  3. 去重算法:URL 去重 + 内容去重 + 同域合并,三层策略更可靠

7.3 核心原则

记住信息搜索师云天眼的铁律:只搜索,不分析。有来源的数据才是数据,没来源的只是噪音。

八、下一步计划

  1. GitHub 认证:一条命令 gh auth login 解决
  2. 知乎 Cookie:引导用户配置持久化 Cookie
  3. 雪球连接:排查网络与登录态问题
  4. Firecrawl MCP:调试启动时序,解决连接关闭问题

关联阅读

  • [[从配置修复到生产级架构:搜索 Agent 云天眼的完整演进实录]]
  • [[Agent-Reach安装部署教程]]
  • [[博客流水线技术复盘:HITL 审核跳过事故的根因分析与代码门控修复]]

参考来源


–全文完–

感谢阅读
若你有故事想讲、有困惑想聊、或是想找个人说说心里话,甚至只是吐槽发泄一下情绪,都欢迎来找我聊聊:   《内容已折叠,点击展开》

希望我写的每一个字,成为我自己和某个人活下去、拼下去的力量。                     《内容已折叠,点击展开》

“技术终归是工具,而我们一次次认真把问题理顺,守住的其实不只是页面样式和代码输出,还有那一点不愿被混乱打败的心气,是每一个深夜仍愿点灯前行的人。”

转载请注明来自https://oklife.me。

文尾配图水墨画图片