2026/8/29 21:38:39

Sequential Enumeration in Large Language Models

Sequential Enumeration in Large Language Models 文章主要内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)的序列枚举能力,通过系统实验探究了5款主流LLM(含专有模型如GPT-5、Gemini 2.5 Pro,开源模型如Llama系列、Qwen 32B)在两类核心任务中的表现:命名任务(How-many):要求模型统计给定字母或单词序列的元素数量;生成任务(Give-N):要求模型生成指定数量的字母或单词序列。实验设计了四种提示策略(明确计数、自发计数、心理计数、禁止计数),并结合模型规模对比、隐藏状态动力学分析(PCA与神经元调谐),核心发现包括:仅在明确提示计数时,LLM(尤其是专有模型)能展现较可靠的枚举能力,且生成任务表现优于命名任务;无明确计数提示时,所有模型均无法自发进行系统性计数,仅能通过近似估计给出接近目标值的结果;模型规模与枚举性能呈渐进式正相关(Llama系列从3B到70B参数的精度逐步提升),但非"阈值式涌现";隐藏状态分析显示,心理计数条件下模型会形成类似"内部计数器"的低维动力学轨迹,而明确计数依赖表层token预测机制,缺乏深层数量语义理解。二、创新点任务设计创新:首次同时采用命名任务与生成任务,且覆盖字母/单词、均质/异质序列,