用 Codex Skills + 红狐数据 API 搭一个 AI 热点雷达

沉默王二在掘金给出的完整实录:把红狐数据的新媒体 API 封装成 4 个标准 Agent Skills,用 Codex 半天搭出 aihot.paicoding.com——每天凌晨自动抓抖音 / 小红书 / 公众号三平台 AI 热点,交给 LLM 做结构化分析与机会评分,前端 5 分钟读完当天该聊什么。

基本信息

  • 来源类型:网页文章(掘金文章,经 Telegram bot 补录、scripts/http_capture.py 抓取正文)
  • 原文位置:raw/articles/2026-06-10-143708-tg-f8273e.md
  • 原文 URLhttps://juejin.cn/post/7649329229150650378
  • 作者:沉默王二(来源:掘金)
  • 消化日期:2026-09-22(Telegram 补录;该 URL 的正文此前已有另一版摘要 2026-06-10-codex-skill-aihot-radar,两条 raw 内容同源)

核心观点

  1. 红狐数据把「多平台新媒体数据」做成了 API 超市,开发者不必再写爬虫:覆盖抖音、小红书、公众号、视频号、快手、微博、今日头条,四大类接口——公众号 6 个(账号搜索 / 文章搜索 / 账号信息 / 文章详情 / 作品列表 / URL 直查)、小红书 2 个(账号详情 + 作品详情)、抖音 2 个(账号 + 作品基础信息)、工具类 3 个(AI 图片生成 image2-GPT、视频生成 Seendance 2.0、图片生成 Seedream 5.0 lite)。另有 Skills 广场 40+ 开箱即用技能,热门调用量:公众号 10w+ 文章推荐 3.6 万次、抖音热门账号推荐 2.5 万次、全网热点追踪 2.1 万次。作者对价值的判断是”拿到 API 之后想怎么用就怎么用,搭看板、写脚本、接 Agent、做自动化,都行”。

  2. AI 热点雷达 = 采集 → 补全 → LLM 分析 → 静态站点,五个组件串成一条链DailyAihotAgentRunner 由 SkillLoader(读 SKILL.md/references 拿采集策略与关键词)→ RedFoxCollector(执行 Skill scripts / 调 RedFox API)→ LlmAnalyzer(调 LLM 出结构化分析)→ Validator(校验 JSON 字段与长度)→ SiteBuilder(生成 HTML/JSON)组成。页面分四区:每日摘要(各平台样本数 + Agent 推荐条数)、Agent 精选推荐(按 opportunityScore 排序)、三平台数据面板(各 5 条原始数据)、在线查询(嵌 9 个 API 查询卡片)。

  3. 机会评分不是 LLM 随口打的,而是”数据基础分 + LLM 微调”:脚本在发给 LLM 之前,先根据关键词匹配度与互动数据(点赞、评论、分享、收藏)算出 40–96 分的基础分,LLM 只在此基础上微调,“确保评分有数据支撑”。LLM 必须返回严格 JSON,含五部分:dailySummary / topPicks(每条带机会评分、内容角度建议、风险提示)/ platformInsights / contentAngles / riskNotes;LLM 调用失败(超时、额度不足)时退化为模板生成的基础分析。

  4. 4 个 Skill 是三件套结构,可跨 Codex / Claude Code / PaiCLI 复用douyin-search(抖音爆款作品搜索,泛化词自动扩展为 10 个细分关键词)、wechat-10w-hot(公众号 10w+ 文章推荐)、xiaohongshu-weeklytop(过去 7 天各领域爆款 TOP50,覆盖 25 个垂直分类)、trending-hub(聚合百度/知乎/微博/抖音/B站/快手/今日头条 7 平台热搜,按小时更新)。每个 Skill = SKILL.md(决策手册)+ scripts/(Python 脚本)+ references/(参考资料)。实测:在 Agent 里说”帮我看看最新的公众号 10w+ 文章”,Agent 自动加载 wechat-10w-hot 并调 fetch_hot_articles.py 拉数据。

  5. 半天上线靠的是”不自建基础设施”的取舍:数据源买 API 不写爬虫、LLM 用 OpenAI 兼容接口(默认 DeepSeek v4-pro,可切换)、部署交给 GitHub Actions + Nginx + systemd、没有数据库——每天数据写入 dist/data/latest.json 并归档到 dist/archive/YYYY-MM-DD.json,前端直接读 JSON 渲染。成本:红狐 API 每天调 15–20 次(三平台搜索 + 抖音详情补全),LLM 一次结构化分析约 2000–3000 tokens。

  6. 容错是多层的,且失败信息要落到输出里:单个平台失败不影响其他平台;每个平台有备用 Skill,主 Skill 超时后降级;API 调用之间留 0.15–0.25 秒延迟避免触发频率限制;最终 JSON 带 errors 数组记录所有异常,便于排查。GitHub Actions 的构建校验也带硬门槛:任何一个平台返回 0 条数据就标记失败

实操内容保留

代码/配置

公众号文章搜索 API 调用(统一 POST + JSON,认证走 X-API-KEY 请求头):

curl -X POST "https://redfox.hk/story/api/gzhData/searchArticle" \
  -H "Content-Type: application/json" \
  -H "X-API-KEY: ak_your_api_key" \
  -d '{"keyword": "AI智能体", "offset": 0, "sortType": "_4"}'

排序参数:sortType_4 按阅读数倒序,_2 按发布时间倒序。响应结构:

{
  "code": 2000,
  "msg": "成功",
  "data": {
    "total": 100,
    "hasMore": true,
    "list": [
      {
        "title": "文章标题",
        "author": "作者",
        "readCount": 100001,
        "likeCount": 606,
        "commentCount": 3,
        "shareCount": 2613,
        "publishTime": "2026-06-07 18:00:00",
        "workUrl": "https://mp.weixin.qq.com/s/xxx"
      }
    ]
  }
}

GitHub Actions 环境变量(密钥经 GitHub Secrets 注入,不进代码仓库):

env:
  REDFOX_API_KEY: ${{ secrets.REDFOX_API_KEY }}
  LLM_API_KEY: ${{ secrets.LLM_API_KEY }}
  LLM_BASE_URL: ${{ secrets.LLM_BASE_URL }}
  LLM_MODEL: ${{ secrets.LLM_MODEL }}

Nginx 站点配置 + API 代理(本地 Python 代理服务端口 5173):

location / {
    root /home/www/aihot;
    try_files $uri $uri/ /index.html;
}
 
location ^~ /api/ {
    proxy_pass http://127.0.0.1:5173/api/;
    proxy_set_header Host $host;
    proxy_set_header X-Real-IP $remote_addr;
}

公众号封面图防盗链的图片代理(补上正确 Referer):

location ^~ /wechat-img/ {
    proxy_pass https://mmbiz.qpic.cn/;
    proxy_set_header Host mmbiz.qpic.cn;
    proxy_set_header Referer "https://mp.weixin.qq.com/";
}

Prompt 模板

流水线组件结构(原文给出的 DailyAihotAgentRunner 编排):

DailyAihotAgentRunner
├── SkillLoader      → 读取 SKILL.md / references
├── RedFoxCollector  → 执行 Skill scripts / 调 RedFox APIs
├── LlmAnalyzer      → 调 LLM 生成结构化分析
├── Validator        → 校验 JSON 字段和长度
└── SiteBuilder      → 生成 HTML / JSON

LLM 必须返回的五段式 JSON:dailySummary(当天数据整体概述)、topPicks(跨平台精选,每条带 0–100 机会评分 + 内容角度建议 + 风险提示)、platformInsights(各平台策略洞察)、contentAngles(整体内容切入角度)、riskNotes(整体风险提醒)。Prompt 里会带上 Skill 的元数据与参考资料,让 LLM 理解每个平台的数据结构和评判标准。

Skill 目录结构(三件套):

skills/
├── douyin-search/           # 抖音爆款作品搜索
├── wechat-10w-hot/          # 公众号10w+文章推荐
├── xiaohongshu-weeklytop/   # 小红书七日爆款笔记
└── trending-hub/            # 全网热点追踪(7平台聚合)

操作步骤

采集流水线(GitHub Actions 每天 00:30 自动执行,run_daily_agent.py

  1. 加载 Skills:读取 skills/ 目录下的 SKILL.md,获取每个平台的采集策略、API 参数与关键词配置

  2. 并行采集三平台数据(每个平台独立逻辑):

    平台采集方式关键词数据量
    抖音关键词搜索 + 作品详情补全AI5 条(含完整互动数据)
    小红书爆款笔记查询AI工具、AI编程、AI智能体、Agent、大模型5 条
    公众号热门文章查询AI工具、AI编程、AI智能体、Agent、大模型5 条
  3. 补全抖音作品详情:搜索接口返回较简略,对排名靠前的 5 条再调一次 queryWork 接口,拿完整点赞数、评论热词、封面图、作者信息

  4. 交给 LLM 做结构化分析

  5. 生成站点文件:把数据与分析结果嵌入 HTML,输出到 dist/

  6. 部署:GitHub Actions 通过 SSH 把 dist/ 同步到服务器并更新 systemd 服务

把 Skill 装进 Codex

  1. 在对话里说明要装的 Skill,例如:「我想装这几个Skills:redfox.hk/skills 包括全网热点追踪 小红书爆款笔记 公众号10万+爆款文章推荐。」
  2. 在红狐数据申请一个 API Key
  3. 装完后直接用自然语言调用,Agent 会自动加载对应 Skill 并执行其脚本

关键概念

  • 2026-06-10-codex-skill-aihot-radar — 同一 URL 的另一版摘要页(旧 raw 消化而来),本页与它互为镜像
  • 红狐数据 — 新媒体数据 API 平台,本文的数据源与 Skills 来源
  • Codex — 承载红狐 Skills 的 Agent 平台,也是这个项目的开发工具
  • Skill — 标准三件套(SKILL.md + scripts/ + references/)封装采集与分析流程
  • DeepSeek — LLM 分析的默认模型(v4-pro),走 OpenAI 兼容接口
  • GitHub Actions — 每天 00:30 定时执行采集与分析,并 SSH 部署产物
  • opportunityScore(机会评分)— 0–100 分,先由脚本按关键词匹配度 + 互动数据算 40–96 基础分,再由 LLM 微调
  • 未创建的概念:Agent Skills 三层加载机制(同名 Skill 覆盖 + 热重载)——本文仅一句话提及,暂不单独成页

与其他素材的关联

  • 2026-06-10-codex-skill-aihot-radar 的关系:同一篇原文(同一 URL)的另一版摘要页。旧页由 raw/articles/2026-06-10-codex-skill-aihot-radar.md 消化,本页由 Telegram 补录 raw 消化;正文一致,本页仅补入旧页省略的两处细节——第 01 节结尾的项目自述”Codex 前后也就是俩小时的调试,包括上线部署”,以及第 05 节在线查询卡片的收尾说明。
  • 2026-05-31-blocktempo-7-agents-software-factory 的关系:两者都在回答”Agent 干活时人负责什么”——那条素材的答案是 3 个人类审核点 + 工具权限矩阵,本文的答案是”Skill 封装决策逻辑、人只做选题判断”,共同点是把判断权留在人手里,把执行交给 Skill
  • 2026-06-02-woshipm-skill-creation-guide 的关系:本文是”从明确目标出发梳理成标准 Skill 结构”的落地样本——4 个 Skill 各自有清晰的采集目标、关键词配置和备用方案。
  • 2026-06-02-woshipm-codex-agent-workbench 的关系:SkillLoader + Collector + Analyzer + Validator + Builder 五段式正是”Agent 工作台”组件编排的一个具体实现。
  • AI编程开发 的关系:本文属”用 Agent 造工具”一类,官方 Skills 的调用量数据(3.6 万 / 2.5 万 / 2.1 万)是”Skill 生态已有真实需求”的量化证据。

原文精彩摘录

每天凌晨自动跑一遍,把抖音、小红书、公众号三个平台上和AI相关的热点数据全部抓下来,扔给 LLM 做一轮结构化分析,给每条内容的算个评分。打开页面,5分钟就能知道今天有哪些 AI 话题值得聊,非常方便。这个项目用 Codex 前后也就是俩小时的调试,包括上线部署。

机会评分的计算不是 LLM 随意打的。脚本在发给 LLM 之前,会先根据关键词匹配度和互动数据(点赞、评论、分享、收藏)算出一个 40-96 分的基础分。LLM 在此基础上做微调,确保评分有数据支撑。

拿 6 月 8 号的数据来说,评分最高的是新智元那篇《ChatGPT与Codex》,88分。Agent 给出的内容角度是”拆解事件背景与用户争议点”和”结合AI工具给出可复现实操”。

采集过程做了多层容错:单个平台失败不影响其他平台;每个平台有备用 Skill,主 Skill 超时后会降级到备用方案;API 调用之间有 0.15 到 0.25 秒的延迟,避免触发频率限制;最终输出的 JSON 里有 errors 数组,记录了所有异常信息,方便排查。

【 开发者最大的优势是,别人用工具,我们造工具 。】

相关页面