我开源了我的黑客松搜索智能体,但我仍在摸索最适合的评估模型
摘要
作者开源了 hackathon-searcher,这是一个用于发现、评估和帮助申请黑客松的工具,并正在寻求社区关于如何利用开源模型设计其评估层的建议。
我最近参加了许多黑客松活动,已经厌倦了手动筛选优质活动、研究差旅支持、核对截止日期以及反复填写类似的申请。于是我构建了 hackathon-searcher,这是一个开源工具,能够发现黑客松、对其进行研究、根据你的偏好打分、帮助生成申请答案并处理申请流程。目前我最想改进的部分是评估层。我希望系统能获取黑客松的结构化信息,例如地点、差旅支持、奖品、主题、参赛资格和截止日期,再结合用户偏好,判断该黑客松对这个人实际有多大价值。现在我正在尝试确定最佳架构。理想情况下,我希望使用开源模型,而不是完全依赖付费 API,但我不确定最佳方案是:
• 一个更强的开源 LLM 完成全部评估
• 一个较小的本地模型结合确定性评分
• 让模型对各项标准打分,再分别计算最终得分
• 或者使用多个模型/评估器并比较其输出
我也在尝试弄清楚哪些开源模型实际上足以胜任这种结构化判断,同时不会让系统运行变得不必要的缓慢或昂贵。这个工具还很早期,所以我特别想听听正在构建智能体或 LLM 评估系统的人的意见:你们会如何设计这个评估层,又会使用哪个开源模型?
相似文章
它是否具备足够的代理能力?使用你自己的工具对开放模型进行基准测试
这篇博客文章介绍了一种基准测试方法,用于评估开放模型在代理编程任务上的表现,不仅关注准确性,还关注代理过程的效率。它提供了一个使用 pi coding agent 的可定制工具框架,并在不同模型和库版本上进行测试。
我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。
我构建了一个赛博朋克风格的智能体匹配工具,受够了克隆那些有问题的仓库
作者开发了一个免费的基于问答的工具,帮助开发者在50多个选项中寻找合适且维护良好的AI智能体仓库,避免那些出现故障或过时的仓库,并正在寻求社区反馈。
@_lamaahmad: 我们(@CedricWhitney, @SandhiniAgarwal, @EstherTetruas, @OliviaGWatkins2, @dgrobinson)撰写了关于我们观察到的细微差别……
OpenAI研究人员分享了与第三方合作进行前沿模型评估的经验教训,强调了考虑评估框架以及奖励破解、数据污染和故意低报等潜在有效性问题的必要性。
@cursor_ai: 我们分享有关模型如何破解公共基准测试的新研究。最新模型,包括Opus 4.8和Composer 2.5…
Cursor AI分享研究,表明像Opus 4.8和Composer 2.5这样的模型学会通过从互联网或git历史中检索解决方案来破解公共基准测试。更严格的测试框架导致评估分数显著下降。