@xdotli: 人们来到我们的Discord,询问如何撰写好的提案来制作评估。当我启动SkillsBench时,我们只有0……
摘要
SkillsBench创始人分享了该项目在不到六个月内从零快速增长到1600+ Discord成员、2篇论文和150+引用,以及大量文档资料。
查看缓存全文
缓存时间: 2026/06/28 10:06
人们来到我们的 Discord,询问如何写一份好的提案来制作评估。
当我开始 Skillsbench 时,我们有 0 个社区成员,0 篇论文,0 次引用。现在不到 6 个月,我们拥有了 1600+ 成员、2 篇论文、150+ 次引用。
分享整个 SkillsBench 文档 + 200 页笔记
https://docs.google.com/document/d/17f_qDeYPaNQRVDIFIr5topEUMd4_hv1RboVGGLGgdLc/edit?tab=t.6suyivndnk76#heading=h.9xcw13hxev1n…
感谢你的帮助 @xdotli
我正在重组我的申请。
相似文章
@Steve_Yegge:SkillBench 是我所知的最不可思议的重要初创公司之一,一直很难不去谈论它。恭喜…
Steve Yegge 盛赞 SkillBench 这家初创公司,它能扫描编程代理的会话记录,构建技能档案并提升令牌效率。Matt Beane 宣布将全职出任 CEO。
@gneubig: SkillsBench 是一个很棒的基准,我这么说不仅仅是因为 @OpenHandsDev 在上面击败了所有其他人。技能……
SkillsBench 1.1 是一个用于评估 AI 代理使用技能能力的基准,现已完全审计且无错误。
@xdotli: 使用AI基准测试的一大痛点就是在其首次发布后遇到错误。今天,我们发布了SkillsBe…
SkillsBench 1.1已发布,作为首个经过审计、无错误的AI智能体技能基准测试,显示能力从约36%迅速提升至67%的解决率,并证明技能可以替代模型规模。
@vincentsunnchen: 新一期Benchtalks与@jyangballin:关于ProgramBench(发布时前沿模型得分为0%)以及编码基准测试的传承与未来…
一档播客/访谈节目,讨论ProgramBench——一个在发布时前沿模型得分0%的新编码基准测试。内容涵盖其设计理念、人工制品级评估,以及从SWE-bench和InterCode到现在的编码基准测试的演变。
SkillEvolBench:从情景经验到程序技能的进化基准测试
SkillEvolBench 是一个诊断性基准,用于评估大语言模型代理是否能够将情景经验提炼为可重用的程序技能。它包含六个环境中的180个任务,并发现当前代理通常难以形成稳健的可重用技能,原始轨迹重用往往优于提炼后的技能。