AI生成的声明在数学上如何定义为“真实”、“合理”和“可信”?
摘要
一位研究者描述了一个项目,旨在以数学形式化AI生成声明的真实性、合理性和可信度,并寻求关于形式化方法、逻辑和概率论的意见,以构建一个“信任引擎”。
我正在从事一个研究项目,其最终目标不是创建更好的LLM,而是构建一个验证引擎,能够推理AI声明对于特定应用是否足够可信。当前大多数研究聚焦于让AI“更好”,而我想要解决验证方面的问题。我问自己的问题是:一个声明要被称为“真实”、“合理”和“可信”意味着什么?我对哲学层面的答案并不满意,我希望看到数学形式化。我试图回答的一些问题包括:信任能否被形式化为一个函数?它与真实性、证据、证明、约束、不确定性有何关系?应该从概率论、信息论、形式逻辑、图论、拓扑学、范畴论、优化等哪个角度入手?能否将任何声明表示为带有证据、假设、约束和推导的对象?是否存在关于证明AI声明(而不仅仅是信任模型的“置信度”)的现有工作?从数学角度,你如何区分一个真实的声明、一个合理的声明和一个可信的声明?如果你必须从头构建一个信任引擎,你会如何设计?你会使用哪些数学基础?我正在考虑类似于约束满足的方法,其中声明需要满足所有约束(逻辑、数学、证据)才能被认为是可信的。另一种方法是将信任视为证据的极限情况,但我不确定这在数学上是否合理。我请求推荐与这些主题相关的论文、书籍等。同时,我也在寻求可能存在的思维陷阱。我上面提到的想法有什么问题?我最感兴趣的是来自形式化方法、定理证明、数理逻辑、知识表示、验证、优化、信息论和可信AI领域的人们的回复。我特别想听听你们会如何从第一性原理出发设计信任引擎。
相似文章
真正让你信任AI的是什么?不是“听起来正确”,而是像信任一个人或一个机构那样信任它?
一场讨论,探讨哪些具体条件(透明度、可验证的记录、持久的身份、可问责性)能让人们像信任人类或机构一样信任AI系统,而不仅仅是将其视为工具。
面向关键系统的可信代理型人工智能工程
本综述针对关键工程系统中的代理型AI提出了一个可信模型,涵盖了安全、鲁棒性、透明性、可问责性和安全性,涉及电力系统、自动驾驶车辆等领域。
可信AI的真相:表达怀疑、溯源与信念修正作为可工程化的立场
该论文介绍并评估了一种对话代理的行为层,使其能够进行表达怀疑、具有溯源意识的断言以及信念修正,从而提升AI系统的真实性。
生成式AI的认知可信度:高风险工作流中合理依赖的规范性框架
本文提出了一个规范性框架,用于判断在何种条件下,对生成式AI输出的依赖在认知上是合理的。该框架基于三个条件:认知谦逊、认知可及性,以及对认知不公正的抵制。文章分析了法律、医疗和招聘场景中的真实案例。
可验证的AI推理
文章讨论了可验证的AI推理的概念,探讨了可信认证和加密证明等方法,以确保AI生成输出的真实性和来源,而无需重新运行模型。