@no_stp_on_snek: 很酷。GLM似乎就是,算了,我们挺好的。
摘要
一条推文展示了8个LLM在概率问题上的推理轨迹可视化,突出了自我修正和转向的时刻。
很酷。GLM似乎就是,算了,我们挺好的。
查看缓存全文
缓存时间: 2026/07/06 16:08
非常酷。GLM 好像是在说,不,我们挺好的。
stevibe (@stevibe): 你知道每个大语言模型思考轨迹里那个“但是,等一下……”的时刻吗?
我让它变得可见了。
我给 8 个模型问了同一个棘手的概率问题,并把它们的推理过程呈现为树状结构。每当模型否定自己的思路并转向,每当出现“但是……”,每当出现“等等,实际上……”,一个新
相似文章
@stevibe: 你知道每个LLM思维轨迹中那个“但是,等等...”的时刻吗?我把它变得可见了。我让8个模型回答同一个棘手的概率问题……
一个可视化展示,显示8个不同的LLM如何推理一个棘手的概率问题,分支代表自我纠正的时刻,比如“但是,等等……”
@lateinteraction: 非常酷的工作!!
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
@techNmak:我终于找到有人解释为什么LLM推理与常规推理根本不同……没有过度……
一条推文分享了一个链接,提供了一个清晰易懂的解释,说明为什么LLM推理与传统推理不同,并以一个随意的走路视频呈现。
@stevibe:哪些大模型真的“热爱思考”?实测7款模型5道数学题,推理长度大比拼。思考冠军:bo…
7款大模型在5道数学题上的基准测试;Qwen3.5 27B与35B A3B生成最长推理链,每题超10k tokens。