用 Codex Skills + 红狐数据 API 搭一个 AI 热点雷达
沉默王二在掘金给出的完整实录:把红狐数据的新媒体 API 封装成 4 个标准 Agent Skills,用 Codex 半天搭出 aihot.paicoding.com——每天凌晨自动抓抖音 / 小红书 / 公众号三平台 AI 热点,交给 LLM 做结构化分析与机会评分,前端 5 分钟读完当天该聊什么。
基本信息
- 来源类型:网页文章(掘金文章,经 Telegram bot 补录、
scripts/http_capture.py抓取正文) - 原文位置:raw/articles/2026-06-10-143708-tg-f8273e.md
- 原文 URL:https://juejin.cn/post/7649329229150650378
- 作者:沉默王二(来源:掘金)
- 消化日期:2026-09-22(Telegram 补录;该 URL 的正文此前已有另一版摘要 2026-06-10-codex-skill-aihot-radar,两条 raw 内容同源)
核心观点
-
红狐数据把「多平台新媒体数据」做成了 API 超市,开发者不必再写爬虫:覆盖抖音、小红书、公众号、视频号、快手、微博、今日头条,四大类接口——公众号 6 个(账号搜索 / 文章搜索 / 账号信息 / 文章详情 / 作品列表 / URL 直查)、小红书 2 个(账号详情 + 作品详情)、抖音 2 个(账号 + 作品基础信息)、工具类 3 个(AI 图片生成 image2-GPT、视频生成 Seendance 2.0、图片生成 Seedream 5.0 lite)。另有 Skills 广场 40+ 开箱即用技能,热门调用量:公众号 10w+ 文章推荐 3.6 万次、抖音热门账号推荐 2.5 万次、全网热点追踪 2.1 万次。作者对价值的判断是”拿到 API 之后想怎么用就怎么用,搭看板、写脚本、接 Agent、做自动化,都行”。
-
AI 热点雷达 = 采集 → 补全 → LLM 分析 → 静态站点,五个组件串成一条链:
DailyAihotAgentRunner由 SkillLoader(读SKILL.md/references 拿采集策略与关键词)→ RedFoxCollector(执行 Skill scripts / 调 RedFox API)→ LlmAnalyzer(调 LLM 出结构化分析)→ Validator(校验 JSON 字段与长度)→ SiteBuilder(生成 HTML/JSON)组成。页面分四区:每日摘要(各平台样本数 + Agent 推荐条数)、Agent 精选推荐(按 opportunityScore 排序)、三平台数据面板(各 5 条原始数据)、在线查询(嵌 9 个 API 查询卡片)。 -
机会评分不是 LLM 随口打的,而是”数据基础分 + LLM 微调”:脚本在发给 LLM 之前,先根据关键词匹配度与互动数据(点赞、评论、分享、收藏)算出 40–96 分的基础分,LLM 只在此基础上微调,“确保评分有数据支撑”。LLM 必须返回严格 JSON,含五部分:
dailySummary/topPicks(每条带机会评分、内容角度建议、风险提示)/platformInsights/contentAngles/riskNotes;LLM 调用失败(超时、额度不足)时退化为模板生成的基础分析。 -
4 个 Skill 是三件套结构,可跨 Codex / Claude Code / PaiCLI 复用:
douyin-search(抖音爆款作品搜索,泛化词自动扩展为 10 个细分关键词)、wechat-10w-hot(公众号 10w+ 文章推荐)、xiaohongshu-weeklytop(过去 7 天各领域爆款 TOP50,覆盖 25 个垂直分类)、trending-hub(聚合百度/知乎/微博/抖音/B站/快手/今日头条 7 平台热搜,按小时更新)。每个 Skill =SKILL.md(决策手册)+scripts/(Python 脚本)+references/(参考资料)。实测:在 Agent 里说”帮我看看最新的公众号 10w+ 文章”,Agent 自动加载wechat-10w-hot并调fetch_hot_articles.py拉数据。 -
半天上线靠的是”不自建基础设施”的取舍:数据源买 API 不写爬虫、LLM 用 OpenAI 兼容接口(默认 DeepSeek v4-pro,可切换)、部署交给 GitHub Actions + Nginx + systemd、没有数据库——每天数据写入
dist/data/latest.json并归档到dist/archive/YYYY-MM-DD.json,前端直接读 JSON 渲染。成本:红狐 API 每天调 15–20 次(三平台搜索 + 抖音详情补全),LLM 一次结构化分析约 2000–3000 tokens。 -
容错是多层的,且失败信息要落到输出里:单个平台失败不影响其他平台;每个平台有备用 Skill,主 Skill 超时后降级;API 调用之间留 0.15–0.25 秒延迟避免触发频率限制;最终 JSON 带
errors数组记录所有异常,便于排查。GitHub Actions 的构建校验也带硬门槛:任何一个平台返回 0 条数据就标记失败。
实操内容保留
代码/配置
公众号文章搜索 API 调用(统一 POST + JSON,认证走 X-API-KEY 请求头):
curl -X POST "https://redfox.hk/story/api/gzhData/searchArticle" \
-H "Content-Type: application/json" \
-H "X-API-KEY: ak_your_api_key" \
-d '{"keyword": "AI智能体", "offset": 0, "sortType": "_4"}'排序参数:sortType 设 _4 按阅读数倒序,_2 按发布时间倒序。响应结构:
{
"code": 2000,
"msg": "成功",
"data": {
"total": 100,
"hasMore": true,
"list": [
{
"title": "文章标题",
"author": "作者",
"readCount": 100001,
"likeCount": 606,
"commentCount": 3,
"shareCount": 2613,
"publishTime": "2026-06-07 18:00:00",
"workUrl": "https://mp.weixin.qq.com/s/xxx"
}
]
}
}GitHub Actions 环境变量(密钥经 GitHub Secrets 注入,不进代码仓库):
env:
REDFOX_API_KEY: ${{ secrets.REDFOX_API_KEY }}
LLM_API_KEY: ${{ secrets.LLM_API_KEY }}
LLM_BASE_URL: ${{ secrets.LLM_BASE_URL }}
LLM_MODEL: ${{ secrets.LLM_MODEL }}Nginx 站点配置 + API 代理(本地 Python 代理服务端口 5173):
location / {
root /home/www/aihot;
try_files $uri $uri/ /index.html;
}
location ^~ /api/ {
proxy_pass http://127.0.0.1:5173/api/;
proxy_set_header Host $host;
proxy_set_header X-Real-IP $remote_addr;
}公众号封面图防盗链的图片代理(补上正确 Referer):
location ^~ /wechat-img/ {
proxy_pass https://mmbiz.qpic.cn/;
proxy_set_header Host mmbiz.qpic.cn;
proxy_set_header Referer "https://mp.weixin.qq.com/";
}Prompt 模板
流水线组件结构(原文给出的 DailyAihotAgentRunner 编排):
DailyAihotAgentRunner
├── SkillLoader → 读取 SKILL.md / references
├── RedFoxCollector → 执行 Skill scripts / 调 RedFox APIs
├── LlmAnalyzer → 调 LLM 生成结构化分析
├── Validator → 校验 JSON 字段和长度
└── SiteBuilder → 生成 HTML / JSON
LLM 必须返回的五段式 JSON:dailySummary(当天数据整体概述)、topPicks(跨平台精选,每条带 0–100 机会评分 + 内容角度建议 + 风险提示)、platformInsights(各平台策略洞察)、contentAngles(整体内容切入角度)、riskNotes(整体风险提醒)。Prompt 里会带上 Skill 的元数据与参考资料,让 LLM 理解每个平台的数据结构和评判标准。
Skill 目录结构(三件套):
skills/
├── douyin-search/ # 抖音爆款作品搜索
├── wechat-10w-hot/ # 公众号10w+文章推荐
├── xiaohongshu-weeklytop/ # 小红书七日爆款笔记
└── trending-hub/ # 全网热点追踪(7平台聚合)
操作步骤
采集流水线(GitHub Actions 每天 00:30 自动执行,run_daily_agent.py)
-
加载 Skills:读取
skills/目录下的SKILL.md,获取每个平台的采集策略、API 参数与关键词配置 -
并行采集三平台数据(每个平台独立逻辑):
平台 采集方式 关键词 数据量 抖音 关键词搜索 + 作品详情补全 AI 5 条(含完整互动数据) 小红书 爆款笔记查询 AI工具、AI编程、AI智能体、Agent、大模型 5 条 公众号 热门文章查询 AI工具、AI编程、AI智能体、Agent、大模型 5 条 -
补全抖音作品详情:搜索接口返回较简略,对排名靠前的 5 条再调一次
queryWork接口,拿完整点赞数、评论热词、封面图、作者信息 -
交给 LLM 做结构化分析
-
生成站点文件:把数据与分析结果嵌入 HTML,输出到
dist/ -
部署:GitHub Actions 通过 SSH 把
dist/同步到服务器并更新 systemd 服务
把 Skill 装进 Codex
- 在对话里说明要装的 Skill,例如:「我想装这几个Skills:redfox.hk/skills 包括全网热点追踪 小红书爆款笔记 公众号10万+爆款文章推荐。」
- 在红狐数据申请一个 API Key
- 装完后直接用自然语言调用,Agent 会自动加载对应 Skill 并执行其脚本
关键概念
- 2026-06-10-codex-skill-aihot-radar — 同一 URL 的另一版摘要页(旧 raw 消化而来),本页与它互为镜像
- 红狐数据 — 新媒体数据 API 平台,本文的数据源与 Skills 来源
- Codex — 承载红狐 Skills 的 Agent 平台,也是这个项目的开发工具
- Skill — 标准三件套(SKILL.md + scripts/ + references/)封装采集与分析流程
- DeepSeek — LLM 分析的默认模型(v4-pro),走 OpenAI 兼容接口
- GitHub Actions — 每天 00:30 定时执行采集与分析,并 SSH 部署产物
- opportunityScore(机会评分)— 0–100 分,先由脚本按关键词匹配度 + 互动数据算 40–96 基础分,再由 LLM 微调
- 未创建的概念:Agent Skills 三层加载机制(同名 Skill 覆盖 + 热重载)——本文仅一句话提及,暂不单独成页
与其他素材的关联
- 与 2026-06-10-codex-skill-aihot-radar 的关系:同一篇原文(同一 URL)的另一版摘要页。旧页由
raw/articles/2026-06-10-codex-skill-aihot-radar.md消化,本页由 Telegram 补录 raw 消化;正文一致,本页仅补入旧页省略的两处细节——第 01 节结尾的项目自述”Codex 前后也就是俩小时的调试,包括上线部署”,以及第 05 节在线查询卡片的收尾说明。 - 与 2026-05-31-blocktempo-7-agents-software-factory 的关系:两者都在回答”Agent 干活时人负责什么”——那条素材的答案是 3 个人类审核点 + 工具权限矩阵,本文的答案是”Skill 封装决策逻辑、人只做选题判断”,共同点是把判断权留在人手里,把执行交给 Skill。
- 与 2026-06-02-woshipm-skill-creation-guide 的关系:本文是”从明确目标出发梳理成标准 Skill 结构”的落地样本——4 个 Skill 各自有清晰的采集目标、关键词配置和备用方案。
- 与 2026-06-02-woshipm-codex-agent-workbench 的关系:
SkillLoader + Collector + Analyzer + Validator + Builder五段式正是”Agent 工作台”组件编排的一个具体实现。 - 与 AI编程开发 的关系:本文属”用 Agent 造工具”一类,官方 Skills 的调用量数据(3.6 万 / 2.5 万 / 2.1 万)是”Skill 生态已有真实需求”的量化证据。
原文精彩摘录
每天凌晨自动跑一遍,把抖音、小红书、公众号三个平台上和AI相关的热点数据全部抓下来,扔给 LLM 做一轮结构化分析,给每条内容的算个评分。打开页面,5分钟就能知道今天有哪些 AI 话题值得聊,非常方便。这个项目用 Codex 前后也就是俩小时的调试,包括上线部署。
机会评分的计算不是 LLM 随意打的。脚本在发给 LLM 之前,会先根据关键词匹配度和互动数据(点赞、评论、分享、收藏)算出一个 40-96 分的基础分。LLM 在此基础上做微调,确保评分有数据支撑。
拿 6 月 8 号的数据来说,评分最高的是新智元那篇《ChatGPT与Codex》,88分。Agent 给出的内容角度是”拆解事件背景与用户争议点”和”结合AI工具给出可复现实操”。
采集过程做了多层容错:单个平台失败不影响其他平台;每个平台有备用 Skill,主 Skill 超时后会降级到备用方案;API 调用之间有 0.15 到 0.25 秒的延迟,避免触发频率限制;最终输出的 JSON 里有 errors 数组,记录了所有异常信息,方便排查。
【 开发者最大的优势是,别人用工具,我们造工具 。】