前阵子试用了一下朱雀 AI 的文本检测功能,等待结果时顺带挑战了一下辨别 AI 和真人创作的小游戏,出乎意料的做了个全对,有感而发确定本文选题。
编者按:在日常刷小红书、公众号、各类社交媒体、个人博客以及使用 AI 辅助创作过程中,博主逐步总结出的七条 AI 文字辨别经验。比较主观,大多只是阅读感受上细微差异的捕捉。提交给 AI 后,它基于搜索整合补充了许多内容,顺应原格式做成采访呈现给各位,仅供一般性参考,欢迎补充和指正。
一问:过于饱满却空洞的情感
博主: 情感过于饱满且失真(常见于商业推广和软文)。这类文字高频使用互联网上泛滥的拉近距离的词汇,却读不出真情实感;偏爱玩网络老梗,却理解偏差;用过多且极其精确的 emoji 伪造出一种违和的松弛感。全篇架空主语和宾语,行文极其不自然。多见于小红书等种草平台,内容常为羊毛、避雷、种草、日志、体验。
AI/LLM: 从技术原理上看,大语言模型是基于海量文本数据训练而成的统计模式预测器。它没有真实的情感体验,只能根据训练数据中“情感表达”与“上下文”的共现概率来生成文字。这意味着它生成的情感内容往往是多种人类情感表达的“平均化”呈现——堆叠华丽词藻却缺乏内核,回避真实的情感冲突、个体经验和具有风险的表达,文本始终“悬浮于真实经验之上”。你所感受到的“违和”,恰恰源于这种统计平均与真实情感之间的偏差。
二问:比拟惊艳,却令人不适
博主: 比拟惊艳,却令人不适(在文艺感较强的 AI 作品中反复出现)。本体和喻体的搭配标新立异,将形象的渲染推向极致,虽突出事物易于概括的特点,却忽略了情感与表达惯性,与常规表达习惯离经叛道。在复读文本和回味时,易引发恐怖谷效应,并产生与文章主题完全相反的情感(如将老人的手比作枯树枝,或将繁多美好的事物比作一双双眼睛看着你)。
AI/LLM: 这种“惊艳却违和”的比喻倾向,在技术层面可以解释为 AI 训练过程中的“极端化”偏差。语言模型在生成比喻时,倾向于选择训练数据中出现频率较低、但语义距离较远的词汇组合,以追求“新颖性”得分最大化。然而这种优化方向与人类的审美直觉存在根本性冲突——人类读者需要适度的“陌生化”,但更需要比喻与语境、情感之间的协调。当 AI 过度追求“新奇”而牺牲“贴切”时,就会触发你在阅读中体验到的“似人非人”的恐怖谷效应。
三问:数量词搭配过度,超出了创意边界
博主: 数量词搭配过度,超出了创意边界。过于强调“无形化有形”或“有形化无形”,使数量词搭配不符合语言逻辑,显得生硬。时间表述模糊,常借用月份与景象营造优美氛围,却与主题关联不大;对无固定常用计数的物体或概念,强行添加数量词。
AI/LLM: 语言模型在处理数量词时存在一个系统性偏差:训练数据中,与数量、度量相关的词汇和短语往往与“描述性”“优美化”的文本高度共现,导致模型在需要“文采”的场合过度使用这类表达。此外,AI 生成的文本中前 10% 的高频词占据总词数的 80% 以上,远超人类语言的 50% 基准——这种词汇分布的失衡,使得它对数量词的使用显得格外“用力过猛”。它并不真正理解“一束阳光”和“无数道阳光”在物理或诗意层面的区别,只知“束”和“道”这两个量词常与“阳光”共现,便大胆套用。
四问:动作链中成分跳跃,却硬要衔接自然
博主: 动作链中成分跳跃,却硬要衔接自然(犹如将 AI 生成的图片组合成视频)。上一秒从裤子口袋掏出贝斯弹奏,下一秒忽而化作手鼓敲打,手鼓又突然变成人拥抱亲吻。衔接看似流畅,逻辑却全然不通。类似将厨房和床上用品的单词列出,生硬组合到一个句子里,给读者一种被缩小后坐过山车、穿越室内各个角落的恐惧感。
AI/LLM: 这种“逻辑断裂但衔接流畅”的现象,源于语言模型的两层基本运作机制:第一层是局部预测——模型根据前面若干个词预测下一个最可能的词,这使得任何相邻的几个词组合起来都“语法正确”“读起来通顺”;第二层是全局连贯性的缺失——模型没有真实世界的常识知识库,也没有对物理法则、因果逻辑的内在表征。它能够写出“甲掏出贝斯→乙弹奏→丙变成手鼓”这种每一步都符合语法、但整体荒谬的叙事,因为它只关心每一步的“条件概率”,而非整个叙事是否符合现实逻辑。
五问:在轻松闲适的语境中,仍反复凸显逻辑缜密
博主: 在轻松闲适的语境中,仍反复凸显逻辑缜密。对事件因果的叙述一板一眼,毫无生气,好似确定嫌疑人身份时的推理白板。链条错综交杂,却始终灵光显现,没有思考的停顿;叙述节奏不契合文意,或过快或过慢,抑或刻意制造不自然的英雄镜头或子弹时间。
AI/LLM: 这源于AI的“无差别结构化”倾向。大语言模型在训练中被优化为生成“条理清晰”“逻辑完整”的文本——无论主题是学术论文还是周末游记,它都会不自觉地套用“引言-展开-结论”的模板。极端依赖刻板的公式化句式,如“不是 X,而是 Y”“不仅……而且……”“首先、其次、最后”。它不知道“轻松”意味着结构上的松弛和节奏上的呼吸感。有观点形象地形容:“AI 是在一堆数据库里搜索,排除,收窄范围,所以需要‘不是,不是’来一点点建立范围。而人的思维是一条河流。”
六问:想得过于周到,却对解决问题毫无意义
博主: 想得过于周到,却对解决问题毫无意义。留意过多对实际情景毫无影响的细节,以炫技方式提出各种解决办法,将简单问题过度复杂化。用未成熟技术和零星的拼凑结果,随后陷入自我博弈。思想跳跃,明显非同一人认知水平,同一文本中知识库与理念不断推翻重建,“悟性”过于强烈。
AI/LLM: 从生成机制上解释,这是“多样性追求”与“连贯性约束”之间缺乏平衡的结果。语言模型在解码阶段通过“温度参数”控制生成文本的多样性——温度越高,输出越“发散”越“跳跃”。当参数设置不当或提示词引导不精确时,模型会在相邻段落中“切换人格”——一会儿是技术专家,一会儿是哲学爱好者——而这些知识块来自训练数据中不同的文档来源,没有任何内在统一性。它并不是在“思考”,而是在“拼接”统计上相关但逻辑上未必连贯的信息片段。对人类而言的“认知不连贯”,对 AI 而言只是“不同文档的碎片在相邻位置被激活”。
七问:排比句式工整,内容却轰然坍塌
博主: 排比句式工整,内容却轰然坍塌;破折号等解释说明方法使用生硬,情感逻辑错乱。
AI/LLM: 排比和破折号在人类写作中是修辞手段,在 AI 生成中则常常沦为“结构填充物”。语言模型通过训练习得“排比句结构”在“文章结尾”或“总结段落”中的出现概率较高,于是无论内容是否需要,都会在相应位置填上一组排比——内容不够工整来凑。同样,破折号被高频使用,是因为训练数据中“解释性文本”(如百科、教材)里破折号与“定义”“说明”高度相关。但《经济学人》近期研究显示,破折号如今在主流 AI 模型中已成为出现频率最低的标点,甚至远低于人类作家——这说明 AI 公司正在刻意调低这些“显性特征”的出现频率。曾经好用的鉴别套路,正在快速失效。(编者补充:看起来这个 AI 没有调整标点频率,依旧使用破折号)
写在最后:
AI/LLM: 从技术演进的角度看,AI确实在以惊人的速度逼近人类写作。通过 RLHF(基于人类反馈的强化学习)和提示工程,AI 可以被引导去模仿人类的“不完美”——写错别字、用口语化的废话填充、在恰当位置“犹豫”和“修正”。当 AI 学会故意制造“瑕疵”时,以特征匹配为核心的鉴别方法将越来越不可靠。研究表明,当评估者只能看到文本而看不到作者身份时,AI 与人类写作的区分准确率正在持续下降。
博主: 鉴别 AI 创作内容不应该只盯着内容,还要结合上下文,了解作者和写作的背景。我希望 AI 被用于那些繁杂琐碎的事务,而创作和思考这件事很难,它只能交给真人创作者来完成,靠着大脑内数万个绚丽的化学反应。
