社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作
社交媒体上随处可见AI生成的内容,尤其是LinkedIn上
安全公司Pangram通过Chrome扩展收集超100万条帖子,分析发现社交媒体AI生成内容泛滥。整体AI检测率13.8%,长文(超250词)中25.72%完全由AI生成。LinkedIn最为严重,超40%长文帖子被标记为完全AI生成,占全部AI内容的62%;X/Twitter近一半文章(23.9%完全AI+22.9%混合)为AI写作。Reddit整体AI率仅4.4%,但顶层帖子AI率达11.6%。分析使用Pangram 3.3模型,假阳性率0.01%。Substack上长文AI率反而略低。
LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。
两个月前,我们推出了我们的 Chrome 扩展程序,以帮助应对社交媒体上日益严重的 AI 垃圾内容问题。它让用户在滚动浏览社交媒体时扫描帖子,标记出 AI 生成的内容,以便他们能够做出明智的决定,决定如何分配自己的注意力。
Pangram 是一家研究优先的公司,不仅体现在我们业界领先的 AI 检测算法上,也体现在追踪 AI 生成内容的风险和普遍程度上。社交媒体是这方面最难研究的领域之一——远比新闻文章、研究论文或亚马逊评论要难得多。但它同时也是最关键的领域之一,因为它可能是我们面临的 AI 生成内容中体量最大的来源。
我们认为,理解这个问题非常重要,这样我们才能更好地应对它。因此,我们在 Chrome 扩展程序中加入了一个选择性开启的设置,允许用户通过匿名分享他们的扫描统计数据来帮助我们的研究。我们将最初几个月的数据汇编成了下面的报告。
主要发现:
- 社交媒体上每四条长文帖子中就有一条被标记为完全由 AI 生成
- 在我们标记为 AI 生成的所有帖子中,三分之二来自 LinkedIn
- X/Twitter 上近一半的文章包含 AI 写作
AI 生成内容对长文形式的冲击最为严重
在我们的数据集中,AI 生成内容出现在所有社交媒体平台上。所有被扫描内容的平均 AI 比例为 13.8%,但具体比例因平台和内容长度而异。在五个平台中的四个上,较长内容比短内容更可能是 AI 生成的。在所有平台上,四分之一的长文内容(超过 250 词的内容中有 25.72%)是完全由 AI 生成的。
Substack 是一个例外;在那里,完全由 AI 生成的内容比例保持相对平稳,而且较长、较有实质内容的帖子实际上比短帖更不可能是 AI 生成的。
LinkedIn 是 AI 渗透率最高的平台,其中超过 40% 的长文帖子被标记为完全由 AI 生成。然而,如果我们将 AI 与人类混合内容也计入,X/Twitter 的情况最糟糕:近一半的 X 文章要么完全由 AI 生成(23.9%),要么是AI 辅助/混合内容(22.9%),只有 53.2% 的 X 文章被标记为完全由人类撰写。
我们的数据显示,AI 生成内容在所有平台上都是一个普遍问题,而且对长文内容的冲击尤为严重。即便是 Substack——长文平台中综合 AI 比例最低的——仍有超过五分之一的帖子(21.9%)被标记为 AI 生成或 AI 辅助。这与我们在其他写作领域看到的 AI 生成内容增长趋势一致,例如报纸评论文章。
AI 垃圾内容正在淹没 LinkedIn
LinkedIn 的 AI 内容占比在所有平台中全面居首。LinkedIn 帖子占扫描内容的三分之一,却占我们标记出的全部 AI 内容的近三分之二(62%)。与人们可能的预期相反,在与其真实身份相关联的职业场景中,人们绝大多数愿意使用 AI 来代表自己发言,而在休闲和匿名平台上则不太可能这么做。
LinkedIn 还通过多种方式鼓励在其平台上使用 AI,包括内置的“Write with AI”按钮(现已更名为“Enhance post”,但仍提供 AI 写作辅助)。人们正注意到 LinkedIn 因垃圾内容而日益增长的名声——或许是为了应对这一问题,LinkedIn 的一位高管最近宣布,该平台将使用内部算法检测并降低 AI 生成帖子的排名;讽刺的是,这则公告本身就是 AI 生成的。无论该公司是否在试图调节其信息流中的 AI,我们的用户仍然在 LinkedIn 上看到大量 AI 写作内容。
顶层帖子比回复更多由 AI 生成
在我们的数据中,Reddit 的扫描量是所有平台中最高的,占我们扫描内容的 36.7%。然而,Reddit 的 AI 综合占比仅为 4.4%,是所有平台中最低的之一。这是由于一种构成效应:Reddit 上的回复绝大多数由人类撰写(98.1%),而回复总共占我们扫描的 Reddit 内容的 72%。Reddit 上的顶层帖子则更可能是 AI 撰写的,占帖子的 11.6%,与 X/Twitter 的 10.0% AI 饱和度相当。同样的模式也出现在 LinkedIn 上,尽管程度较轻:LinkedIn 的顶层帖子由 AI 生成的可能性是评论的 1.35 倍。
尽管 LinkedIn 的回复比帖子更不可能是 AI 生成的,但在控制长度后,这一效应发生了反转:LinkedIn 评论实际上比顶层帖子略微更可能是 AI 生成的。对于 Reddit,AI 比例的差异与帖子形式无关——在控制长度后,Reddit 顶层帖子由 AI 生成的可能性仍然高出 5.25 倍。
Reddit 上无 AI 参与的回复揭示了许多反机器人策略的盲区。虽然Reddit 的垃圾信息政策能有效清除使用 AI 自动生成垃圾回复的账号,但这种方法只能捕获平台上最低成本的垃圾内容。Reddit 顶层帖子仅占所有 Reddit 内容的四分之一,但它们对受众的影响要大得多,而且其较低的发布量使得 AI 撰写的帖子能够绕过基于数量的审核机制,例如速率限制。
方法与数据收集
总体而言,自 2026 年 4 月 24 日 Chrome 扩展程序上线以来,选择共享数据用于研究的用户帮助我们构建了一个包含 1,002,627 篇帖子 的数据集,覆盖互联网上几个最大的社交媒体平台:LinkedIn、Medium、Substack、X/Twitter 和 Reddit。数据集中的每篇帖子只计数一次,我们只扫描 超过 50 个词 的内容。每篇帖子都用 Pangram 3.3 进行了分析,这是我们最新的 AI 检测模型,其 假阳性率 为 0.01%。这个数据集让我们能够直接了解此时此刻人们在信息流中看到的 AI 生成内容究竟是什么。
结论
AI 写作如今在社交媒体上处处都是问题。 这令人担忧,但与我们在网上其他地方看到的情况一致:研究人员估计,开放互联网上新发布的网站中有 35% 是 AI 生成或 AI 辅助完成的。一个完全被未披露的 AI 内容淹没的互联网是黯淡的,但我们不相信这是不可避免的。我们希望通过为网上的 AI 生成内容提供透明度,让互联网用户重新获得一些对自身注意力投向的掌控权。
来源:Hacker News 热门(buzzing.cc 中文翻译) · pangram.com