我开源了我的黑客松搜索智能体,但我仍在摸索最适合的评估模型

Reddit r/AI_Agents 工具

摘要

作者开源了 hackathon-searcher,这是一个用于发现、评估和帮助申请黑客松的工具,并正在寻求社区关于如何利用开源模型设计其评估层的建议。

我最近参加了许多黑客松活动,已经厌倦了手动筛选优质活动、研究差旅支持、核对截止日期以及反复填写类似的申请。于是我构建了 hackathon-searcher,这是一个开源工具,能够发现黑客松、对其进行研究、根据你的偏好打分、帮助生成申请答案并处理申请流程。目前我最想改进的部分是评估层。我希望系统能获取黑客松的结构化信息,例如地点、差旅支持、奖品、主题、参赛资格和截止日期,再结合用户偏好,判断该黑客松对这个人实际有多大价值。现在我正在尝试确定最佳架构。理想情况下,我希望使用开源模型,而不是完全依赖付费 API,但我不确定最佳方案是: • 一个更强的开源 LLM 完成全部评估 • 一个较小的本地模型结合确定性评分 • 让模型对各项标准打分,再分别计算最终得分 • 或者使用多个模型/评估器并比较其输出 我也在尝试弄清楚哪些开源模型实际上足以胜任这种结构化判断,同时不会让系统运行变得不必要的缓慢或昂贵。这个工具还很早期,所以我特别想听听正在构建智能体或 LLM 评估系统的人的意见:你们会如何设计这个评估层,又会使用哪个开源模型?
查看原文

相似文章