连飞猪都来学的AI系统:30天从外部AI到私有化+RAG

产品经Lee写给同行PM的实战笔记:把一个已上线、已创造价值的文旅OTA AI运营系统做增量增强,从外部依赖到私有可控、可验证、可规模化。

基本信息

核心观点

  1. 定位增量增强而非重构:已上线、团队高频依赖的文旅OTA AI运营系统(AI 运营助手专员)无需推倒重来,只需局部增强私有化,从外部公有云API替换为本地可控,降低风险、提升可控性。
  2. 行业背书:飞猪团队专程来学:同行头部平台登门研究“含硅量100%”的AI嵌入运营链路范式(开关班、调价、竞品分析、客服答疑),证明“落地范式”比技术模型更稀缺。
  3. RAG核心:先补召回域:早期外部AI+大杂烩知识库答错率40%,通过按知识域分层(L1渠道规则、L2经营定价、L3营销内容、L4客服FAQ,3218条)命中率直接提升至100%(零模型改动)。
  4. 私有化决策:Qwen2.5-7B Q4_K_M量化后约6.3GB显存(RTX 4060 8GB),Dify1.16.1+双部署(主备+心跳路由)+0公网连接审计,数据不出网。
  5. 可验证上线:L0-L5六层测试 + 21个联调场景,AI问答答案率10/10,双链路切换10/10,18个OTA模块待回归。

实操内容保留

必填节。原文中可直接复用的内容必须原样保留。

知识域分层召回(实战步骤)

L1渠道规则(20条):各OTA平台开班、佣金、结算规则
L2经营定价(2508条):套餐定价、调价逻辑、毛利口径
L3营销内容(582条):推广软文、活动文案
L4客服FAQ(108条):退款、改期、投诉等售后口径

问定价只在L2找、问退款只在L4找,营销软文彻底退出召回池。

双部署与可验证审计

  • 主服务:本机
  • 备服务:内网172.21.13.19等价服务
  • 路由层rag_entry:持续发心跳探主服务,主挂自动切备
  • 进程级网络审计:抓rag_entry进程所有对外连接,只连127.0.0.1和备机,0个公网连接。

联调验收L0-L5六层

  • L0:基础设施探活(/health主/备alive)
  • L1:接口契约(请求/响应字段断言)
  • L2:AI问答质量(真实10题库验证答案正确域)
  • L3:双链路切换(主挂自动切备,答案仍可用)
  • L4:异常容错(全挂、超时、编码错误兜底)
  • L5:性能跨机(耗时、并发、跨机稳定性)

21个联调场景覆盖工作台、账号管理、产品列表、批量任务、渠道流量、竞品监控、AI问答7个模块。

关键概念

  • RAG — 检索增强生成,先查资料再让模型回答,答案可追溯、更新成本低
  • 向量库与Embedding — 语义相似度搜索,不是关键词匹配
  • 私有化部署 — 开源模型下载到自有机器,数据不出内网
  • Dify — 编排平台(曾卡住2天,用本机RAG直连+手段-目标分离后端到端通过)
  • 双部署 — 主备+心跳路由,故障无感切换
  • Qwen2.5-7B Q4_K_M量化 — 精度-显存平衡,6.3GB显存
  • bge-reranker — 重排模型,提升top-3相关分0.70→0.90

与其他素材的关联

(暂无关联素材)

原文精彩摘录

必填。原文中选取2-3段最有价值的原文,原样保留。

过去大半年,我主导搭了一套跑在业务里的文旅 OTA AI 系统:它接渠道运营的日常操作(开关班、调价)、做竞品价格分析、做数据分析,原来几个小时的重复活儿,现在几秒干完。它一直在线跑、团队高频依赖,整体是稳的——这一点必须先说清楚:这次升级不是给“烂系统”打补丁,而是给“已上线、已创造价值”的系统做增量增强。

命中率从2.7%直接到100%,且零模型改动。

模型选型上我做了精度-显存权衡:Qwen2.5-7B用Q4_K_M量化(显存约6.3GB,塞进8GB的4060),再压精度掉、再上显存放不下——这是PM要在“效果”和“资源”之间划的一条明确红线。

进程级网络审计——抓rag_entry进程的所有对外连接,结果只连127.0.0.1和那台备机,0个公网连接。原来要走外部AI的数据,现在全留在内网。

吞吐(req/s):每秒能处理多少请求;平均延迟/p95延迟:用户等多久,p95代表绝大多数用户的体验;失败率:并发下有没有报错、有没有超时。

吞吐不再涨、但延迟持续上涨,就是系统饱和的拐点,此时再加并发没用,要换推理框架或扩容实例。

相关页面