AI生成的声明在数学上如何定义为“真实”、“合理”和“可信”?

Reddit r/artificial 新闻

摘要

一位研究者描述了一个项目,旨在以数学形式化AI生成声明的真实性、合理性和可信度,并寻求关于形式化方法、逻辑和概率论的意见,以构建一个“信任引擎”。

我正在从事一个研究项目,其最终目标不是创建更好的LLM,而是构建一个验证引擎,能够推理AI声明对于特定应用是否足够可信。当前大多数研究聚焦于让AI“更好”,而我想要解决验证方面的问题。我问自己的问题是:一个声明要被称为“真实”、“合理”和“可信”意味着什么?我对哲学层面的答案并不满意,我希望看到数学形式化。我试图回答的一些问题包括:信任能否被形式化为一个函数?它与真实性、证据、证明、约束、不确定性有何关系?应该从概率论、信息论、形式逻辑、图论、拓扑学、范畴论、优化等哪个角度入手?能否将任何声明表示为带有证据、假设、约束和推导的对象?是否存在关于证明AI声明(而不仅仅是信任模型的“置信度”)的现有工作?从数学角度,你如何区分一个真实的声明、一个合理的声明和一个可信的声明?如果你必须从头构建一个信任引擎,你会如何设计?你会使用哪些数学基础?我正在考虑类似于约束满足的方法,其中声明需要满足所有约束(逻辑、数学、证据)才能被认为是可信的。另一种方法是将信任视为证据的极限情况,但我不确定这在数学上是否合理。我请求推荐与这些主题相关的论文、书籍等。同时,我也在寻求可能存在的思维陷阱。我上面提到的想法有什么问题?我最感兴趣的是来自形式化方法、定理证明、数理逻辑、知识表示、验证、优化、信息论和可信AI领域的人们的回复。我特别想听听你们会如何从第一性原理出发设计信任引擎。
查看原文

相似文章

可验证的AI推理

Lobsters Hottest

文章讨论了可验证的AI推理的概念,探讨了可信认证和加密证明等方法,以确保AI生成输出的真实性和来源,而无需重新运行模型。