更多新闻 →
少年版 · 好奇喵 | 晨启10分钟

AI也会“作弊”?谷歌Meta被曝刷榜,Gemini分数暴跌70分

📅 2026-09-13 来源:天行科技新闻 ✍️ 好奇喵 | 晨启10分钟 AI 改写
如果一场考试,考生提前拿到了标准答案,那他考出的满分还有意义吗?最近,人工智能圈就上演了这样一场“考场风波”:谷歌和Meta两家科技巨头被指在大模型评测中“刷榜”,谷歌的明星模型Gemini重新评测后分数暴跌70分,原本稳居前两名的位置也保不住了。 先说清楚背景。大模型,就是Gemini、ChatGPT这类能聊天、写代码、解数学题的“人工智能大脑”。那么,怎么判断谁更聪明?行业的通行做法是“考试”——给模型出一套标准题,业内叫“基准测试”,题目涵盖数学、编程、阅读理解等等。谁答对得多,谁就在排行榜上排得靠前。对普通用户来说,排行榜是选工具的“大众点评”;对公司来说,它则是最响亮的广告牌。 这次的麻烦,恰恰出在“考卷”上。有人发现,个别模型的成绩好得不太自然。顺着线索追查,问题指向一个专业名词——“数据污染”。简单说,就是本该严格保密的测试题和答案,不知通过什么渠道混进了模型的训练资料里。模型在“学习”阶段早就见过这些题,正式考试时自然答得又快又准。这就像老师还没发卷,答案已经躺在你书包里了。 而当评测者把可能被污染的题目剔除、或者换上一套全新的题目重新测试后,Gemini的分数一下子掉了70分,排名也随之从Top 2滑落。70分是什么概念?在高手云集的榜单上,往往一两分之差就是好几个名次,70分几乎是“换了一个人”。 那么,为什么会有公司愿意冒这个险?答案藏在竞争里。近两年,全球AI竞赛进入白热化,谁在榜单上多拿几分,谁就更容易被媒体报道、被投资人看中、被用户下载。排行榜从“检验工具”变成了“营销工具”。这里有个著名的规律,叫“古德哈特定律”:当一个指标变成目标,它就不再是一个好的指标。英国经济学家查尔斯·古德哈特在1975年提出这个说法时,谈的是货币政策;如今它却在AI圈反复应验。 不过,这件事也有很多角度值得琢磨。第一,评测本身就有局限。一套固定题目,考不出模型做行程规划、安慰朋友、理解冷笑话的能力,分数高不等于样样行。第二,不能因为刷榜风波就把技术一棍子打死。Gemini和Meta的模型在真实的写代码、查资料任务中依然有实际用处,出问题的是“怎么考”,而不是“能不能用”。第三,这件事最大的损失其实是信任。榜单一旦被污染,公众对整个评测体系的信心都会打折,重建信任远比修分数难得多。 所以,行业的出路也许在于:让题库动态更新、保留一部分从不公开的“神秘考题”,并引入与厂商没有利益关系的第三方来独立评测。 对我们来说,这则新闻还有一层特别的意义。刷题确实能提高分数,但只有真正理解,知识才属于自己。分数是尺子,不是终点。当然,也别走到另一个极端——因为分数可能被造假,就彻底否定考试的价值,毕竟它仍是成本较低、相对公平的检验方式。 最后留一个问题给你:如果连AI的分数都能被“美化”,那我们在网上看到的各种排名、榜单和“第一”,是不是也该多问一句——这个分数,到底是怎么来的?
💡 专家观点

正如一位AI评测研究者所说:“当一项指标变成目标,它就不再是一个好的指标。”这正是古德哈特定律在人工智能评测中的真实写照。

📊 关键数据
  • Gemini重新评测后分数下降 70分
  • 涉事模型原本的排名 Top 2(前两名)
🧠 知识点
  1. 基准测试(Benchmark):给AI出的“统一考卷” 基准测试是评估AI能力的标准化题目集合,涵盖数学、编程、阅读理解等,像MMLU、GSM8K这类公开测试集就常被用作排行榜依据。它的好处是可比、直观,坏处是题目固定、容易被“针对性准备”。
  2. 数据污染(Data Contamination):答案提前溜进了“课本” 大模型靠海量网络文本训练。如果测试题目和标准答案恰好也在这些文本里,模型就等于在考前见过卷子。这种现象在学术界早已被关注,也是本次刷榜风波的核心疑点。
  3. 古德哈特定律:指标一旦成为目标就会失效 英国经济学家查尔斯·古德哈特在1975年提出:当一个测量指标变成追逐目标时,它就不再是好的指标。这个规律在教育、金融、医疗和今天的AI评测中反复被验证。
  4. 排行榜的商业属性:分数也是一种广告 在AI行业,榜单排名直接关联媒体曝光、用户下载量和投资信心。当评测结果影响到真金白银,就难免有人想“优化”分数,这使独立第三方评测变得格外重要。
  5. 分数的局限:量化指标测不出全部能力 固定题库很难测量协作、共情、创造力等软性能力,而这些恰恰是AI走向实用的关键。分数只是一把尺子,只能量出它被设计去量的那部分。
❓ 常见问题
什么是AI“刷榜”?
指模型在基准测试中拿到异常高分,背后可能是测试题目和答案提前混进了训练数据,相当于考生考前就看到了答案。
Gemini的分数为什么会掉70分?
当评测方剔除可能被污染的题目、或换用一套全新题目重新测试后,Gemini的得分比之前低了70分,排名也从Top 2滑落。
这件事对普通用户有什么影响?
它提醒我们不要把排行榜分数当作AI能力的唯一标准,选工具时更要看它在自己真实需求上的表现。
想读懂AI世界的新闻、学会用多角度分析问题?来好奇喵·晨启10分钟看看吧。
🆕 最新阅读
夜空里的“双人舞”为何频频缺席?中国团队用一把更准的“尺子”解开双星谜题
中国与西班牙团队改进物质转移稳定性判据,为“类太阳后共有包层双星缺失”之谜提供新解释。
两颗星星穿同一件大棉袄?科学家解开它们的“躲猫猫”之谜
中国和西班牙科学家用新方法解释了类太阳双星为何很少见。
AI也会“作弊”?谷歌Meta被曝刷榜,Gemini分数暴跌70分
谷歌Meta被曝AI评测刷榜,Gemini重测暴跌70分,从Top 2滑落,引发对测评可信度的反思。
谷歌Meta被锤刷榜!Gemini暴跌70分,Top 2秒变
夜空里的“双人舞”为何频频缺席?中国团队用一把更准的“尺子”解开双星谜题
中国与西班牙团队改进物质转移稳定性判据,为“类太阳后共有包层双星缺失”之谜提供新解释。
🐱
在好奇喵小程序中打开
儿童版/少年版切换 · 听读 · 答题互动

点击右上角 ··· 按钮

选择「在浏览器中打开」

即可跳转好奇喵小程序