llms

标签

Cards List
#llms

@paul_cal: 太棒了:你可以问LLM的魔法问题来探测一些潜在状态。就像是黑箱模型的mech interp探测。

X AI KOLs Following ↗ · 昨天 缓存

一种叫做虚假探测的技术使用自适应API级别搜索来找到能够揭示黑箱LLM潜在状态的问题,例如通过特定提示区分能力评估。

0 人收藏 0 人点赞
#llms

在LLM时代如何保持对编程的热爱

Lobsters Hottest ↗ · 2天前

本文探讨了尽管 Large Language Models 日益普及,程序员如何保持对编程的热情和乐趣的策略。

0 人收藏 0 人点赞
#llms

@ylecun: 感谢提及“elderly”,不过请看这个:

X AI KOLs Following ↗ · 2天前 缓存

Yann LeCun 重申了他的立场,即仅凭自回归大语言模型无法实现人类水平的人工智能,并强调了非自回归搜索在当前AI推理系统中的作用。

0 人收藏 0 人点赞
#llms

@ArielKwiat: "当一位杰出但年长的科学家说某事是可能的时候,他几乎肯定是正确的。当他……"

X AI KOLs Following ↗ · 2天前 缓存

一条引用推文突出了Yann LeCun的声明,即扩大LLMs规模无法实现人类水平的智能或AGI,称这种想法为'完全胡说'。

0 人收藏 0 人点赞
#llms

当今大多数'AI智能体'只是挂载了LLM的if-else工作流,并非真正的智能体

Reddit r/AI_Agents ↗ · 2天前

文章认为,大多数所谓的AI智能体实际上是附加上了LLM的简单工作流,缺乏真正的适应性,并提供了一种测试方法来区分真正的智能体与伪装的工作流。

0 人收藏 0 人点赞
#llms

Lobsters:将vibecoding重命名为llms(Greasemonkey脚本)

Lobsters Hottest ↗ · 3天前 缓存

一个适用于Lobsters网站的Greasemonkey脚本,将'vibecoding'标签重命名为'llms',以显示与大型语言模型相关的内容。

0 人收藏 0 人点赞
#llms

从静态个人价值观到情境化个性化:针对LLMs的贝叶斯个性化价值对齐

arXiv cs.AI ↗ · 3天前 缓存

本文提出了BaCVA,一种用于大语言模型情境化个性化价值对齐的推理时贝叶斯方法,通过整合静态个人价值观与情境特定显著性来提高适应性和数据效率。

0 人收藏 0 人点赞
#llms

基于AI代理的流行病模型驱动:Epydemix代理框架

arXiv cs.AI ↗ · 3天前 缓存

Epydemix代理框架扩展了一个开源流行病建模库,使AI代理能够处理从自然语言到结果的建模过程,提高了可重复性和效率。

0 人收藏 0 人点赞
#llms

LLMs中的数学推理按方法组织,而非主题

arXiv cs.AI ↗ · 4天前 缓存

本研究探讨大语言模型是否内部按主题或方法组织数学推理,发现方法是关键组织原则的证据,挑战了传统的基准测试方法。

0 人收藏 0 人点赞
#llms

Transformer可以同时持有两个想法:LLMs中线性叠加的证据

Hugging Face Daily Papers ↗ · 4天前 缓存

本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。

0 人收藏 0 人点赞
#llms

Hill Sampling for Test-Time Scaling: A Simpler, Superior Alternative to Repeated Sampling, Evolution, and Training

arXiv cs.LG ↗ · 5天前 缓存

Hill Sampling is a simple test-time scaling method that uses frozen LLMs to iteratively sample and edit the best-verified program, achieving state-of-the-art results on algorithmic problems like circle packing and Erdős' minimum-overlap problem.

0 人收藏 0 人点赞
#llms

TicTacBench: Benchmarking the Timing Closure Capabilities of Coding Agents

arXiv cs.AI ↗ · 5天前 缓存

TicTacBench is a new benchmark designed to evaluate the timing closure capabilities of coding agents in RTL design. It reveals that current agents have significant room for improvement and proposes TicTacSkill to enhance their performance.

0 人收藏 0 人点赞
#llms

勿信基准测试:通用LLM排名的局限与任务特定评估的倡导

arXiv cs.AI ↗ · 5天前 缓存

本文探讨了通用LLM排名的局限性,包括基准饱和与商业激励,并倡导任务特定评估方法以提高可靠性。

0 人收藏 0 人点赞
#llms

AI代理是否已为企业就绪?

Reddit r/AI_Agents ↗ · 5天前

本文探讨了AI代理是否已为企业使用做好准备,强调了在部署中确保安全性和可预测性以防止未授权行动的关键需求。

0 人收藏 0 人点赞
#llms

@VraserX: Spirit AI 拥有大约1,000人反复操作真实物体,为机器人生成训练数据。LLMs 免费获得了互联网。

X AI KOLs Following ↗ · 6天前 缓存

Spirit AI 正在使用大约1,000人手动操作真实物体,为机器人生成训练数据,与用于大型语言模型的免费互联网数据形成对比。

0 人收藏 0 人点赞
#llms

SWE-Proof:语言模型能否通过机器检查证明解决现实世界问题?

arXiv cs.LG ↗ · 2026-09-21 缓存

本文介绍了SWE-Proof,这是一个针对现实世界软件问题的经过形式验证的代码补丁基准,表明形式验证能提高LLM生成代码的错误检测能力,并将规范综合识别为一个关键开放问题。

0 人收藏 0 人点赞
#llms

LogicTrack:使用形式化逻辑求解器审计大型语言模型的推理轨迹

arXiv cs.AI ↗ · 2026-09-21 缓存

LogicTrack 是一个神经符号框架,通过形式化逻辑求解器审计大型语言模型的推理轨迹,以确保逻辑有效性,从而同时提升推理链的可验证性和最终答案的准确性。

0 人收藏 0 人点赞
#llms

GameASG-Bench:游戏开发中自主软件生成基准测试

arXiv cs.AI ↗ · 2026-09-21 缓存

GameASG-Bench 是一个用于评估游戏开发中自主软件生成系统的基准测试平台,它通过静态与运行时检查来纳入行为可测试性。

0 人收藏 0 人点赞
#llms

与机器对话的错位:人机对话中的道德、礼貌与对齐

arXiv cs.CL ↗ · 2026-09-21 缓存

本研究比较了人机对话与人人对话中道德、礼貌和对齐的作用,发现AI再现了合作的表面特征,但缺乏内在的社会适应性。

0 人收藏 0 人点赞
#llms

@threeaus: 我强烈推荐大家观看Jev创始人Diogo Almeida的这次演讲,他早就预测了一切……

X AI KOLs Timeline ↗ · 2026-09-20 缓存

本文推荐Jev创始人Diogo Almeida的一次演讲,批评了ChatGPT和Claude Code等AI模型中RLHF的使用,并倡导超越人类偏好优化的真正自动化。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈