我用agent做了个运动打卡数据治理流程
来源:掘金 · Gyrate · 2026-08-08 | 约 2904 字
核心观点
-
OCR + AI 混合策略降本增效:全量视觉识别处理 13 张图片的 docx 耗时约 30 分钟、成本约 0.42,但出现两处数据错误。最终方案为 OCR 负责文字/数字识别,AI 负责理解字段含义和聊天上下文,OCR 缺字/错位/冲突时标为待核查,人工确认后再用视觉识别回看原图补齐——兼顾成本和准确率。
-
“人定规则、Agent 执行”的分工范式:Agent 不是一句”帮我整理运动记录”就能跑通的。作者先将需求、输入输出格式、异常处理规则写清楚(Markdown 格式的 prompt),再交给 TRAE Work 执行下载、识别、输出 CSV。核心原则是”不确定时不要猜测,不写入正式数据”,每条记录保留可追溯的原图或来源位置。
-
完整数据治理链路:下载群聊归档 → OCR 识别文字 + AI 理解上下文 → 生成 records.csv + evidence.md → 导入数据库 → 人工核查异常记录 → 生成统计报表 → 智能问数(接入 TRAE Work 对话查询或钉钉机器人)。每周处理时间从 60 分钟降至 10-20 分钟,下降 67%-83%。
-
真实成效数据:已创建 1210 条运动记录,累计运动 65588 分钟(约 1093.1 小时)。识别通过率经多轮迭代接近 100%。
-
可复用模式:这套”图片多、规则明确、又需要留痕”的方法可迁移到财务发票整理、行政巡检照片、物流回单处理、报名表归档等场景。共同特点是让 AI 先做文件整理/文字读取/字段抽取/异常标记,人力集中在少量需要判断的地方。
实操内容保留
给 TRAE Work 下发的 Prompt 模板
请处理指定日期范围内的运动群归档文件。
任务要求
1. 通过API下载并整理 docx 中的文字、图片、发送人和发送时间
2. 识别有效运动打卡,忽略闲聊、排行榜和无关图片
3. 输出运动时间、提交时间、人员、运动类型、运动时长、卡路里、原图路径和核查状态
4. 对重复记录、时间不完整、字段冲突和低置信内容标记为待核查
5. 输出 records.csv 与 evidence.md
处理原则
- 不确定时不要猜测,不要写入正式数据
- 每条记录必须保留可回看的原图或来源位置
- 运动时间和提交时间分开保存具体操作步骤
第一步:在 TRAE Work 中打开 sportcheckin 工程,用自然语言告诉 Agent 要处理的日期范围。Agent 按指令下载对应的群聊记录,读取聊天文本和运动截图,结合提交人的上下文整理运动数据。处理完成后生成 records.csv,同时输出识别摘要、来源信息和过滤诊断。
第二步:将 CSV 导入数据库管理系统(也是 vibe coding 生成),系统将已核查记录和待核查记录分开。核查页面把原图、识别字段和异常原因放在一起,管理员对照截图修改字段,确认核查结果。
第三步:系统基于数据库中的有效记录生成报表,可查看总体打卡情况、按人员筛选、通过排行榜了解参与情况。
第四步:智能问数——将数据库的只读 API、调用方式和字段说明提供给 Agent(TREA Work 等),让 Agent 按问题获取数据,直接在对话中完成查询和汇总。也可接入钉钉机器人,群成员直接提问查看个人运动信息和趋势分析。
关键概念
- TRAE Work:本文使用的 AI Agent 开发平台,可进入已有工程读取项目约定、调用工具、写回文件,与 vibe coding 生成的数据库管理系统配合
- OCR + AI 混合策略:OCR 识别文字/数字(降本),AI 理解字段含义和上下文(提质),两阶段分工
- 数据治理工作流:非结构化数据 → Agent 结构化 → 人工核查 → 统计报表 → 智能问数的完整链路
- Agent 的分步下指令:不是一句话笼统描述,而是把输入输出格式、异常规则、处理原则分条写清
与其他素材的关联
- 与 Pix2Text 有直接关联:本文使用的 OCR + AI 混合策略与 Pix2Text 的”看字不用大模型”定位一致。文中 OCR 角色可由类似 Pix2Text 的工具承担
- 与 AI产品成本核算 有关联:文章给出了全视觉识别 vs OCR+AI 的具体成本对比数据(0.42,即 OCR+AI 成本仅为全视觉识别的 26%)
- 与 AI Agent 智能体 有关联:展示了 Agent 从”给出建议”到”进入工程、调用工具、写回结果”的实干能力
- 与 AI办公自动化 主题有关联:运动打卡数据治理是 AI 办公自动化的典型落地案例
原文精彩摘录
我之前用同一份含 13 张图片的 docx 做过测试。全量视觉识别加大模型理解,识别效果很好,但耗时约 30 分钟,测试成本约 1.63 美元。改成 OCR 先读取文字,再交给大模型整理,同一份资料约 2 分钟,成本约 0.42 美元,不过出现了两处数据错误 。对比之下,全部使用AI大模型视觉识别通过率高(但不代表正确率100%),但费用高不可持续;使用OCR识别成本低,但通过率没那么高。
这次实践让我更清楚地看到,AI 能不能进入真实工作,首先取决于人是否理解业务。哪些记录可以采用,哪些数据必须核查,出现缺失和冲突时怎样处理,这些规则需要人来确定。规则说清楚以后,AI 才能稳定地接手下载、识别、整理和统计这些重复工作。TRAE Work 给我留下较深印象的地方,是它没有把工作停在一段建议或一份示例代码上。它可以进入已有工程,读取项目约定,调用现成工具,再把处理结果写回文件。