AI 文字垃圾正在淹没互联网:从体育新闻幻觉说起

互联网怪盗团用一连串”可被一秒证伪”的体育新闻幻觉,反推出 AI 文字垃圾的完整生产线:人类提供造假动机、AI 提供造假技术、办公 Agent 提供批量产能,而平台只对视频挂”疑似 AI”标签、对文字几乎零管控——最终”文字垃圾”成为视频垃圾的上游原材料。

基本信息

  • 来源类型:文章(人人都是产品经理 · 作者:互联网怪盗团,微信公众号:互联网怪盗团)
  • 原文位置:raw/articles/2026-09-21-131052-tg-088519.md
  • 原文 URLhttps://www.woshipm.com/it/6466746.html
  • 发布日期:2026-09-20
  • 消化日期:2026-09-21
  • 原文站点:人人都是产品经理(woshipm.com)
  • 原文标签:AIGC、个人观点、内容生态、行业观察
  • 作者数据:互联网怪盗团,在站内 199 篇作品、851283 总阅读量
  • 原文篇幅:标注 15 分钟阅读

核心观点

  1. 体育新闻是 AI 文字垃圾最容易被抓现行的领域,因为事实可一秒证伪。作者连续刷到三类与事实相反的”有鼻子有眼”的报道:① 曼城主帅”瓜迪奥拉今年能否夺回阔别两年的英超冠军”——实际瓜迪奥拉今年不执教任何球队;② “梅西因父亲在医院外遭抢劫而退出国家队”——实际其父已去世,一个已去世的人不可能被抢劫;③ 皇马两场比分被写成 1-1 和 2-2 平局——实际是 0-1 负贝蒂斯、3-2 胜埃尔切。作者由此判断这些全是 AI 制造的文字垃圾,因为”从行文方式中能看出浓浓的 AI 味”。

  2. 幻觉可以被逐条归因到语料库的结构性偏差。作者给出的三个归因机制非常具体:① 瓜迪奥拉执教曼城十年,文字记录深度渗透主流大模型语料库,接替者马雷斯卡知名度低——“如果不启用搜索功能,AI 可能会顽固地认为曼城主教练过去、现在、未来一直都是瓜迪奥拉”;② 梅西父亲被抢劫确有其事(多年前),去世消息在世界杯期间曾被辟谣后成真,AI 把”辟谣信息”与”当年被抢劫信息”错误拼接;③ 皇马比分是 AI”根据 90 分钟正常时间结束时的情况,脑补了全场比赛结束时的比分”(点球射失、补时绝杀都发生在常规时间之外)。

  3. 人类+AI 的”双剑合璧”才是真正可怕之处——AI 幻觉在造假商业闭环里不是缺点,而是核心竞争力。作者原有一个观点:“AI 再怎么胡说八道,也不如人类的胡说八道更可恶”,因为幻觉是客观技术缺陷、人类说谎是主观逐利行为。现在他修正为:人类负责提供造假动机(省钱、不懂行、不想花时间),AI 负责提供造假技术手段,形成”商业闭环”。自媒体”因为想省钱,所以不愿为 Token 付费;因为不懂行,所以 Prompt 乱写,加剧了而不是减轻了 AI 幻觉;因为不想花时间,所以没有检查生成结果直接就发出来了”。

  4. 文字垃圾已进入”全自动工业”阶段,工具形态是 AI 办公 Agent + 自制 Skill。作者猜测大量文字垃圾由 OpenClawWorkBuddy 等 AI 办公工具全自动批量制造:作者写一个所谓 Skill,从中英文权威媒体不停抓取”第一手信息”,由 AI 组织语言(其中产生大量幻觉),根据当天媒体热搜起标题加标签,然后群发各平台。历史类内容则是”洗稿”的工业化——最早由通晓外语的作者从巴西出版物译介(如”巴西黑奴沦为育种机器、生下几百个孩子”的故事),其他自媒体反复洗稿,AI 把洗稿从手工行为发展为”扔进原始文章 + 一两句指引就能创造全新文章”的全自动工业,作者甚至可能刻意引导 AI 产生幻觉以增加”原创性”、规避平台判抄袭

  5. 文字垃圾的危害被系统性低估,因为它比视频垃圾”权威性”更高、管控更松、成本更低。作者给出三层判断:① 权威性——对受过一定教育的受众,文字仍比视频更权威,观点向/科普向视频往往以文字稿为基础二次传播,“必须先有一个文字垃圾,才有衍生的视频垃圾”;② 成本——AI 视频比文字更烧钱,即使 Seedance 大幅降价,“现在要生成在短视频平台看得过去的视频,每分钟至少也得几百元(以平均 10 次抽卡计算)“,这笔钱够生产并分发几十万字的文字垃圾;③ 管控——AI 视频容易被平台”宁可错杀、绝不放过”地挂上”疑似 AI 生成”标签,“至于文字,好像压根没人管,我从来没见过一篇文字垃圾被平台挂上’疑似 AI 撰写’的标签”。

  6. 增量重灾区清单:历史类资讯、历史人物传记、券商与咨询公司研究报告。① 历史类资讯已出现”同一故事多版本反复创作”的失控形态(同一个人物的故事”大家的版本都有一点不同,估计很快会产生更离奇的版本”);② 各大门户网站历史频道”可能有三分之一的文章是 AI 根据历史人物简历’充实’出来的文字垃圾”,AI 的主要任务就是根据幻觉增加生动有趣的场景和对话——“由人类自己去编,是很难编出这么多细节的,因为人类扯谎总归有那么一点点羞愧心理,而 AI 的问题是不知道自己在扯谎”;③ 券商研报”虽然由首席分析师挂名,但首席是不写报告的,报告都是实习生写的”,实习生难以抗拒用 AI 写报告的诱惑,首席睁一只眼闭一只眼。

  7. 作者对”AI 写作”本身是分场景接受的,反对的不是 AI 而是”既无文笔也无信息量”。作者明确表示只要内容有干货,不在乎是人写还是 AI 写——他常在小红书搜旅游攻略,“其中不少我一看就知道是 AI 深度润色的,但是没关系,读者需要的只是信息量,又不是文笔”;有些旅游博主确实见多识广、出于分享动机,只是不擅长文字组织或用 AI 组织成”读者喜欢的形式”,“这一点我们是完全理解的”。他判断问题在于绝大部分 AI 生成内容”AI 在其中扮演的是’从垃圾到垃圾’(Rubbish in, rubbish out)的角色”,并用旅游博主(真实经历+AI润色)与体育自媒体(无经历+AI幻觉)构成了一组对照。

  8. 趋势判断:两三内 AI 文字垃圾将占据互联网文字内容的绝对多数。原文判断:“再过两三年,或许用不了那么久,AI 制造的文字垃圾会在互联网文字内容中占据绝对多数,你随手刷到的信息,几乎可以肯定是 AI 制造的、真假难辨的、质量严重堪忧的”,并补充”80% 是来自某个办公 Agent,制造过程只需人类最低程度的干预”。收尾是价值判断:“数千个、数万个’硅基创作者’,就这样以绝对的数量优势,彻底改造着碳基生命的大脑和心灵。“

实操内容保留

(本文为观点评论类文章,无代码、无 Prompt 模板、无分步教程。)

不过原文描述了一条可被复用的”文字垃圾自动生产线”形态,反向读即为内容风控/原创度识别时的特征清单:

操作步骤:疑似批量 AI 内容账号的产出流程(原文描述,非教程)

  1. OpenClaw / WorkBuddy 等 AI 办公工具写一个”所谓 Skill”;
  2. 从中英文权威媒体不停地抓取”第一手信息”(不核对、不回原出处);
  3. 通过某种方式让 AI 组织语言(此环节产生大量幻觉);
  4. 根据当天的媒体热搜起标题并加上标签(选题靠热搜而非领域判断);
  5. 群发到各个平台(多平台同质化铺量)。

变体:洗稿工业化流程

  1. 最早由通晓外语的作者从外文出版物译介一个”有看点”的故事;
  2. 其他自媒体反复”洗稿”、各做自己的版本(早于 AI 时代已存在);
  3. AI 时代升级为:把原始文章扔进 AI + 一两句指引 → 生成全新文章;
  4. 可能刻意引导 AI 产生幻觉,以此增加”原创性”、规避平台判抄袭。

识别信号(作者自述的判断方法)

  • 标题判断是否打开,不再逐篇核对(作者已放弃对抗);
  • 体育/事实类内容可用一秒搜索证伪(主帅是谁、比分多少);
  • 无法证伪的领域(如那个”生了几百个孩子的巴西黑奴”,作者明确说”我至今都不知道他是否存在,因为自媒体作者没有提供他的外文姓名,我尝试了一下,在外网搜不到任何信息”)风险最高。

关键概念

  • AI幻觉 — 全文的分析引擎:幻觉不再只是产品风险,而是造假闭环里的”核心竞争力”
  • AI文字垃圾 — 本文提出的核心概念实体:判定标准、成因结构、重灾区分布
  • 洗稿工业化 — AI 把洗稿从手工行为升级为”扔进原文 + 一两句指引”的全自动工业
  • OpenClaw — 文中所指的”AI 办公工具”,被猜测为文字垃圾全自动生产线的载体
  • WorkBuddy — 同上,与 OpenClaw 并列被点名
  • Seedance 2.0 — 原文用其降价后的成本做”视频垃圾 vs 文字垃圾”性价比对比
  • Claude Opus — 未创建实体页:作者作为反例提出的正面样本——优质前沿大模型 + 打开搜索 + 良好 Prompt + 人工检查,“是绝对不会出现上述幻觉的”
  • 短剧内容生态 — 与本文”平台如何对待 AI 产能”这一问题同构,可对照阅读
  • 双剑合璧闭环 — 未创建实体页:人类提供造假动机 + AI 提供造假技术手段的”商业闭环”
  • 双剑合璧闭环 — 未创建实体页:人类提供造假动机 + AI 提供造假技术手段的”商业闭环”
  • 疑似 AI 生成标签 — 未创建实体页:平台对视频”宁可错杀”、对文字几乎零管控的审核不对称
  • Rubbish in, rubbish out — 未创建实体页:AI 在无干货内容中扮演的”从垃圾到垃圾”角色

与其他素材的关联

  • 2026-07-16-woshipm-ai-hallucination-3-solutions 的关系:视角互补,结论对撞。那篇从 AI 产品经理视角把幻觉定性为”大模型的底层概率属性,永远无法彻底根除”,主张用规则引擎双校验、置信度分层、全链路溯源在产品内兜住风险;本文则把幻觉放到无人兜底的公域内容生态里看——那里既没有规则引擎也没有置信度门控,人类甚至主动引导幻觉。两篇合起来回答了同一个问题的两面:有产品边界的地方可控,无产品边界的地方失控。

  • 2026-07-16-woshipm-ai-interpretability-neil-nanda 的关系:机制层与现象层的对接。可解释性研究用稀疏自编码器在模型内部找到了”我认识这个实体/我不认识这个实体”两个概念,并能通过关掉”认识”让模型面对 Yellow Submarine 也拒绝回答。本文的瓜迪奥拉案例正是这一机制的语料库放大版——模型”认识”瓜迪奥拉、“不认识”马雷斯卡,于是”认识”信号压过了事实。

  • 2026-07-16-woshipm-ai-comic-drama-addiction 的关系:同一判断在视频域的镜像。那篇提出”AI 产能是中性的放大器:既能放大创意也能放大套路”,并给出红果 2026 年 4 月一周下架 3522 部低质漫剧的治理样本;本文则指出文字域连这样的下架机制都还没有,只对视频挂”疑似 AI 生成”标签。

  • 2026-04-29-yupi-ai-guide-intro2026-05-25-openclaw-deepseek-content-automation-sop 的关系:同一批工具的两副面孔。OpenClaw 在本库既以”内容自动化 SOP(选题→创作→审核→发布→复盘,含合规审核 Agent)“的正面形态出现,也在本文以”批量制造文字垃圾”的负面形态被点名——差别恰好在于流程里有没有那个”审核”环节。

  • 2026-05-17-content-creator-20-tips 的关系:同一结论的两种论证。那篇从创作者角度讲”仅 5% 的内容是 AI 无法替代的,判断力才是核心”;本文从读者/受害者角度给出了这条判断的底层原因——AI 产能把”看起来像模像样的文章”的价格打到了零,于是”真正的内容会越来越贵”。

原文精彩摘录

我想强调一下:使用优质前沿大模型(例如Claude Opus),打开搜索功能,输入良好的Prompt,并对结果进行检查,是绝对不会出现上述幻觉的。上述文字垃圾充斥各大信息流平台,纯粹是自媒体(以及个别”专业媒体”)既想省钱、又不懂行、还不想花时间所导致的恶果。因为想省钱,所以不愿为Token付费,或只愿付最低的费用;因为不懂行,所以Prompt估计是乱写的,加剧了而不是减轻了AI幻觉;因为不想花时间,所以没有检查生成结果,直接就发出来了,为人类的知识库带来了永久性的污染。

以前我曾有个观点:AI再怎么”胡说八道”,也不如人类的胡说八道更可恶。当时我的意思是,AI幻觉是一种客观存在的技术缺陷,人类说谎则是一种主观驱动的逐利行为,前者的严重性根本不能与后者同日而语。现在我发觉,最可怕的是”人类+AI”的双剑合璧:人类负责提供造假的动机,AI负责提供造假的技术手段,形成所谓”商业闭环”。AI容易出幻觉、一本正经地胡说八道,在这个闭环当中根本不是缺点,反而是核心竞争力……

平台对视频垃圾的管控也明显更严,因为AI视频容易以假乱真。视频博主都知道,对于疑似AI的视频片段,平台是一贯宁可错杀、绝不放过,随手就给你挂个”疑似AI生成”,在观众心中敲响警钟(实际效果存疑)。至于文字,好像压根没人管,我从来没见过一篇文字垃圾被平台挂上”疑似AI撰写”的标签……

再过两三年,或许用不了那么久,AI制造的文字垃圾会在互联网文字内容中占据绝对多数,你随手刷到的信息,几乎可以肯定是AI制造的、真假难辨的、质量严重堪忧的。还可以加上一句:80%是来自某个办公Agent,制造过程只需人类最低程度的干预。数千个、数万个”硅基创作者”,就这样以绝对的数量优势,彻底改造着碳基生命的大脑和心灵。

相关页面