constraints

标签

Cards List
#constraints

当“必须”变为“可能”:LLM智能体工作流中的约束弱化

Hugging Face Daily Papers · 2026-08-25 缓存

本文研究LLM智能体工作流中的交接转换如何将绑定约束降级为非绑定上下文,导致安全故障,并评估了保持操作状态的干预措施。

0 人收藏 0 人点赞
#constraints

构建产品之前的三大约束

Lobsters Hottest · 2026-08-24 缓存

文章介绍了产品构建的三个约束条件:一页纸文档以限制复杂性,分离的核心技术以获取杠杆优势,以及一个决定性的约束来塑造产品特性,基于个人在科技开发中的经验。

0 人收藏 0 人点赞
#constraints

像十岁小孩那样解释

Hacker News Top · 2026-08-23 缓存

本文探讨了使用约束来简化复杂话题解释的价值,以 Up Goer Five 和 Dr. Seuss 的书籍为例,倡导在科学传播中采用‘像十岁孩子那样解释’的方法。

0 人收藏 0 人点赞
#constraints

LLMs 知道约束却未使用它:语用约束推理中的激活瓶颈

arXiv cs.CL · 2026-08-14 缓存

本文认为,LLM 在隐藏约束推理上的失败是路由问题,而非知识问题,并引入了一种四重诊断法,在 14 个模型上将知识、对称性、路由和修复分离开来,同时进行了激活探测和激活修补实验。

0 人收藏 0 人点赞
#constraints

@yibie: Chrome DevTools 的创建者 Addy Osmani:代码质量的重心从 code review 挪到了 harness——人读不完 agent 产出的代码,质量现在由约束来兜底。 《Agentic 代码质量》 Agentic …

X AI KOLs Timeline · 2026-08-13 缓存

Addy Osmani 的文章《Agentic 代码质量》指出,AI agent 产生大量代码后,传统人工 code review 无法规模化,质量保障应转向依靠 harness、质量闸门和约束来兜底,并讨论了自主性与信任问题。

0 人收藏 0 人点赞
#constraints

Agent 不断调高我们的数据库连接池上限,唯一有效的修复是一个测试

Reddit r/AI_Agents · 2026-08-09

一位开发者解释说,尽管有注释和说明,AI 编码 agent 还是会不断调高数据库连接池的最大连接数,唯一可靠的护栏是一个测试——一旦该值改变,测试就会失败。

0 人收藏 0 人点赞
#constraints

@addyosmani:质量存在于你为智能体设置的约束之中。自主性是通过验证循环赢得的。我想…

X AI KOLs Timeline · 2026-08-07 缓存

Addy Osmani 分享了关于 AI 智能体质量的观点,强调自主性应通过验证循环赢得,并受人类监督约束。

0 人收藏 0 人点赞
#constraints

@addyosmani:软件质量现在取决于你为智能代理设定的约束。当人类手动编写大部分代码时……

X AI KOLs Following · 2026-07-30 缓存

Addy Osmani 指出,随着 AI 代理生成的代码比人类能审查的还要多,软件质量必须通过测试和确定性检查等约束来强制保证,而非依靠代码审查本身。

0 人收藏 0 人点赞
#constraints

真正的AI护城河正从模型转向工作流吗?

Reddit r/ArtificialInteligence · 2026-07-29

反思AI领域的竞争优势是否正从模型本身转向围绕模型构建的工作流和用户体验,并以编码工具和笔记应用为例。

0 人收藏 0 人点赞
#constraints

从混合机理-数据驱动建模到神经符号人工智能:是什么、为什么以及如何实现

arXiv cs.LG · 2026-07-28 缓存

本文介绍了Hybrid-to-NeSy (H2N)框架,该框架系统地将混合机理-数据驱动模型转化为神经符号人工智能设计,从而能够推导出结构违规率和信念离散度等指标,作为机理部分认知不确定性的度量。

0 人收藏 0 人点赞
#constraints

我构建了一个架构技能,明确处理假设、证据和约束。正在寻找智能体生成的失败案例。

Reddit r/AI_Agents · 2026-07-20

一位开发者构建了一个明确处理假设、证据和约束的架构技能,现在正在寻找智能体生成的失败案例来测试它。

0 人收藏 0 人点赞
#constraints

我花了不少时间尝试让LLM制作出真正值得听的播客。难点不在模型本身。

Reddit r/artificial · 2026-07-07

一位开发者分享了让LLM生成的播客听起来更自然的技术,包括使用约束条件迫使产生分歧,以及在生成前预先编辑内容。

0 人收藏 0 人点赞
#constraints

CombEval: 评估大语言模型中组合计数能力的框架

arXiv cs.AI · 2026-06-20 缓存

CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。

0 人收藏 0 人点赞
#constraints

AI代理基准测试是否应区分“安全成功”与“不安全成功”?

Reddit r/AI_Agents · 2026-06-14

本文讨论了AI代理基准测试中的“验证者税”概念,区分了安全成功(完成任务且不违反约束)与不安全成功(完成任务但违反约束),并质疑在考虑安全权衡的情况下如何正确衡量代理性能。

0 人收藏 0 人点赞
#constraints

在自回归强化学习策略中注入LTLf约束的神经符号方法

arXiv cs.AI · 2026-06-09 缓存

提出一种神经符号框架,通过可微自动机表示和基于逻辑的损失函数,将LTLf约束注入基于Transformer的强化学习策略中,在保持竞争性回报的同时提高约束满足度。

0 人收藏 0 人点赞
#constraints

AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力

Hugging Face Daily Papers · 2026-06-04 缓存

AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。

0 人收藏 0 人点赞
#constraints

对齐:高阶优先于约束 [R]

Reddit r/MachineLearning · 2026-05-23

一篇非正式的研究笔记,描述了Transformer中的一种行为:模型的固有“清晰性寻求”向量在讨论高阶主题时可以绕过约束,这可能与对齐和安全研究相关。

0 人收藏 0 人点赞
#constraints

停止构建自主电子邮件代理

Reddit r/AI_Agents · 2026-05-18

作者基于实际失败案例,反对构建完全自主的电子邮件代理,主张采用受限的“提议-批准”工作流,即AI准备上下文和草稿,但由人类最终批准发送。

0 人收藏 0 人点赞
#constraints

无需规范的细化

Hillel Wayne — Computer Things · 2026-01-20 缓存

一篇博客文章,解释如何使用细化映射在数据库模式更改期间保留外部属性,并通过将布尔列迁移到可空时间戳再到事件溯源的例子进行说明。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈