Crucible。一个判断引擎:注册一个论点,为每个主张构建最强反对论证,对照基底进行衡量,优化最薄弱的轴。

Reddit r/artificial 工具

摘要

Crucible是一个开源判断引擎,它将一个论点转化为一组主张,通过对抗性测试为其构建最强反对论证,对照基底预言机进行衡量,并迭代优化最薄弱的轴,产生诸如MATCH、DRIFT或UNVERIFIABLE等裁决。

https://preview.redd.it/xq27po2kf2ch1.png?width=1280&format=png&auto=webp&s=cd373dee36f99bc9b3398a81d77730f84ffcb02e 我一直在开发一个代理式框架、引擎等。我想开始向公众发布一些更有影响力的部分,以便进行测试并获得一些关注。这是其中一件,我将其命名为“crucible”。Crucible将一个论点转化为一组主张,每个主张都配有一个能反驳它的观察。独立的对手通过提出最强测试来为每个主张做最强辩护,引擎对照基底预言机衡量每个主张,并在多轮中优化最薄弱的轴:加强基底、优化衡量标准或修正论点。结果是每个主张的裁决:MATCH、DRIFT或UNVERIFIABLE,基于衡量结果而非评判者的意见。每次运行都会生成一个可重新检查的记录。https://github.com/HarperZ9/crucible 如果你愿意,也许也可以利用我的工具。它涵盖了大量关于可测量感知以及信息/数据转换的内容。但我认为根据你工作的领域,它可能有一些你可以剖析的应用。从那里你可以自由浏览整个资料库,因为里面有很多值得研究的内容。我真的很想把它调校好,因为如果它能获得一点机构资助和关注,这个引擎作为闭环系统可以发挥巨大的作用。到目前为止,基于收据的工作流已成功将企业级的计算和推理能力带入通常非常简单的模型中,使它们能够远超其自身能力水平,甚至可以在代理工作流中端到端地信任运行。我目前在一个仅14B的模型上运行着一些我甚至不信任企业模型处理的数据——如果没有合适的框架的话。我正在积极为我的两篇arXiv论文寻找背书人,以便开始获得某种形式的学术同行评审,因为我的背景与任何行业/学术领域都相距甚远,而且我几乎完全是在家独立完成所有工作。我看到市场/经济正在急剧转向,试图关闭个人使用真正强大工具的途径,而是将它们提供给企业同行和他们的酒肉朋友。我直接想刺中这一点,看着它流血。我真的在用脚试图让那扇门保持敞开,同时争取足够的时间让工具落入人们手中。感觉像是在和时间赛跑。我的目标是让世界级的能力通过人们可以在家使用、且负担得起的工具来实现——使用他们已经拥有的材料,无需支付订阅费。我厌倦了看到人们为了生存而从这个小小的管道中吸取养分。我并没有真正在推销什么——只是公开地开发一系列工具,并发表研究。我正在构建一个(我喜欢称之为)飞轮引擎,它(在本地模型训练/基准测试中)能够将大量实用功能打包进非常小的本地模型中。它甚至通过基于收据的架构来有机地改善数据集,过滤漂移/衰减。这种效率/收据方法正在接近与大型模型原始计算能力直接相当的水平。https://harperz9.github.io/ - https://github.com/HarperZ9 我真正的目标是将结对编程、代理式框架和本地模型能力发挥到极致,同时引入基础设施和标准化,使LLM和AI能够应用于以前从未、也永远无法使用的领域。我还确保构建了一个学习引擎,强调在此过程中保持强烈的个人参与。这基本上是在鼓励我努力跟上,而项目的发展速度远远超过我能跟上的速度。我基本上是一个第二代学生,看着每一个通过工具运行的模型飞速前进。它将每一次与模型的互动都变成了一次协作。而底层的引擎能够向模型提供实时的测量数据,甚至让没有视觉的模型也能感知到给定时刻的范围和状态。我想我最大的问题是如何跟上节奏,并充分衡量和向他人展示研究揭示的潜力。我不是一个很好的展示者,当然也不是最擅长人际交往的人——所以我只是尽力而为,希望一击命中。
查看原文

相似文章

一个拒绝猜测的符号化引擎

Reddit r/artificial

Chiron 是一个精确定位或拒绝的证据门,用于结构化输出,将声明验证为 VERIFIED(已验证)、REFUTED(已驳斥)或 REFUSED(已拒绝),并配有公开的评估历史记录和源代码。