网友吐槽Gemini:对话混淆、指令遗忘,降智严重还爱脑补

admin 商品展示 34

一、用户口中的“阿尔茨海默”式日常体验

网友们所进行的吐槽, 集中于以下几个典型症状, 这几个典型症状正如同阿尔茨海默病那样, 呈现出进行性认知功能障碍。

对话有混淆情况, Gemini在同一对话框跟用户聊C话题时, 还把A的问题掺和进来了, 为此有用户评价说“时聪明时断片”, 有用户抱怨其“你跟它提到三句它能忘掉两句”, 而且它还会突然叫你一个根本不存在的英文名。

命令遗忘、执着犯错: 用户曾对己身作的创作短板进行深刻分析, 而后叮嘱Gemini加以规避, 然而新一轮推出它径直漠视先前的这类提醒, 仍然冒出相同的问题。

许多用户反馈, Gemini在2025年末至2026年中期有显著的“降智”情况, 回答中直接承认自己是“脑补了”, 不仅不读取用户上传的附件, 还胡乱进行编造, 智降程度严重, 幻觉情况泛滥。有用户称, Gemini 3.0版本的中文写作水平“沦落得极其令人愤慨”。

多位认证账号指出, Gemini在运行时, 因算力被全部占用并且被迫降低配置才得以运行, 进而致使体验出现波动, 呈现出如体感变笨以及算力不充足等状况, 用户察觉到在高峰时段(美国上班时间), 该模型的“智商”显著降低, 甚至连多模态的图片解析能力都丧失了。

网友吐槽Gemini:对话混淆、指令遗忘,降智严重还爱脑补-第1张图片-开云手机入口官网下载-开云app官方最新下载--V3.6.9

二、基准测试中的真实得分:并不“极低”

是各类权威学术基准测试里, Gemini的表现亮眼, 在多个项目上还夺得第一, 这和用户体感是截然相反的:

Gemini 3.1 Pro在ARC - AGI - 2(抽象逻辑推理)方面的得分, 相比Gemini 3.0 Pro的31.1%, 实现了翻倍式增长, 飙升至77.1% , 其得分幅度大幅超过Claude Opus 4.6的得分(68.8%)以及GPT‑5.2的得分(52.9%)。

获得高难度学术测试超前成绩: 于Humanity's Last Exam(高级学术推理)里, 取得了44.4%的分数, 这一分数高于GPT‑5.2所获34.5%的分数;在GPQA Diamond(科学知识)方面, 得到了94.3%的分数, 此分数是所有模型当中最高的。

在编码方面以及Agent能力提升上, LiveCodeBench Pro编码竞赛的Elo得分, 从2439提升到了2887, 于此同时, APEX - Agents长链专业任务成功的比率, 由18.4%飞跃涨到了33.5%。

综合智能指数实现登顶, 于Artificial Analysis的10项核心评估里, 获取6项第一, 综合智能指数将Claude Opus 4.6以及GPT‑5.2反超。

三、矛盾背后:为什么“测很高,用很拉”?

造成这种巨大反差的核心原因包括以下几个方面:

算力资源分配呈现不均衡状态, 免费用户以及处于高峰时段的用户, 被迫采用“降配模式”来使用。谷歌运用低价策略比如学生优惠来吸引新用户, 在拉新之后, 算力很快就达到饱和状态, 于是只能对推理开销进行限制, 进而使得模型表现得“变笨”。

版本之间存在着极为巨大的差异, Gemini 3.0、3.1 Pro等经过官方评测的、有着高分的模型, 要想获取完整能力就得付费订阅, 像Google AI Pro或者Ultra这类, 而免费版或者旧版本, 比如2.5系列, 它们在性能方面差距异常悬殊。许多用户所吐槽的版本, 或许并不是最新的3.1 Pro。

测试场景跟真实任务并非匹配: 基准测试, 比如说像ARC - AGI这般, 着重偏向于抽象推理以及单步逻辑, 而用户平常的使用(长对话、多轮任务、文档分析)对长上下文的记忆以及稳定性具备着更高的要求。Gemini在长上下文中出现“注意力涣散”的状况, 容易将前面的内容忘掉。

存在这样一种观点猜测, 谷歌因成本控制以及安全合规的缘故, 对模型实施了过度剪枝, 或者通过安全的基于人类反馈的强化学习训练, 使得模型的推理能力被削弱, 最终致使实际表现比不上跑分。

降智具备“定向性”, 有用户察觉到, Gemini在文生图等特定任务方面依旧很强, 然而在代码生成、长文档分析等场景当中, 质量却急剧下滑, 这表明不同任务或许采用了不一样的路由策略以及算力配额。

四、结论:兄弟并非真傻开云app在线入口开云手机入口官网下载开云真人app官方版入口,开云真人app官网入口,只是需要正确“服药”

经过综合考量, Gemini并非是在学术测试里出现“得分极低”这种情况 , 恰恰相反, 它于最新版本的核心评测当中处在第一梯队。可是, 在实际投入使用的时候 , 鉴于受到算力分配、版本选择、任务类型以及上下文长度的限制 , 诸多用户所体验到的是被“降级”之后的模型 , 就好似一个既时而清醒又时而糊涂的阿尔茨海默患者。谷歌要借助持续的推理优化、算力扩容以及更精细的版本管控 , 才可以使这个“兄弟”真正地恢复到应有的智力水准。

本文由AI生成

标签: Gemini AI评测 算力限制 用户体验 基准测试

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~