标签
Charlie Marsh 宣布,'ty' 工具现在支持高级模式匹配中全部22种控制流分析和类型收窄案例。
本文认为,从 Logic Theorist 到大型语言模型,现代AI本质上仍是一台操控模式而非真正推理或拥有世界模型的三段论机器,这呼应了尚未解决的框架问题。
MathFormer 是一个小型 seq2seq 模型,在符号数学任务上实现了约 98.6% 的准确率,这表明 LLM 中的数学推理可能是一种大规模的结构化模式补全,而非真正的推理。
tropius 是一个命令行工具,使用Aho-Corasick模式匹配和结构检测器来检测散文中的AI写作套路,基于Tropes.fyi的套路列表。
本文介绍了CF-World,一个用于评估文本到图像模型是否依赖因果推理或仅仅是模式匹配的反事实基准。实验表明,所有模型在反事实设置下表现急剧下降,表明它们的理解仅限于视觉-文本紧密耦合的模式,而非真正的因果推理。
一份实用指南,概述了AI代理在上线前应具备的七个优先安全层,包括强化系统提示、对抗性测试、输入/输出扫描以及多轮会话跟踪。基于调查结果,73%的生产级AI部署存在提示注入暴露风险。
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。