今天看啥  ›  专栏  ›  机器之心

AI记忆伪装被戳穿!GPT、DeepSeek等17款主流大模型根本记不住数字

机器之心  · 公众号  · AI  · 2025-06-15 12:40
    

主要观点总结

本文介绍了关于大模型(LLM)的工作记忆能力的实验研究。通过三个实验来检验大模型是否拥有类似人类的工作记忆能力,包括数字猜谜、是-非问答和数学魔术。实验结果显示,主流的大模型未能通过这三项考验,意味着它们并不具备真正的人类工作记忆机制。

关键观点总结

关键观点1: 工作记忆的定义及在人类中的作用

工作记忆负责将刚获得的信息保留几秒到几十秒,并进行推理、计算、对话等复杂操作。对人类来说,它是进行连贯交流、心算和避免前后矛盾的关键。

关键观点2: 三个实验的内容与目的

实验1:数字猜谜,检验大模型是否能在心里保留数字并进行回答。实验2:是-非问答,测试大模型在连续问答中的推理能力。实验3:数学魔术,考察大模型在连续心算中的工作记忆能力。

关键观点3: 实验结果与分析

17个主流大模型在三项实验中表现普遍不佳,未能通过考验。LLaMA-3.1-8B在某些实验中表现超群,但总体来说,大模型仍缺乏真正的工作记忆能力。

关键观点4: 未来研究方向

为了提升大模型的对话真实性和长链推理能力,需要引入真正的工作记忆机制。新的研究方向可能包括借鉴认知科学,引入可读写的「内存格」,或通过强化学习、神经模块化等方法,让模型学会在体内保留并操纵隐变量。


免责声明:本文内容摘要由平台算法生成,仅为信息导航参考,不代表原文立场或观点。 原文内容版权归原作者所有,如您为原作者并希望删除该摘要或链接,请通过 【版权申诉通道】联系我们处理。

原文地址: 访问原文地址
总结与预览地址:访问文章预览/总结
文章地址: 访问文章快照