evaluations

标签

Cards List
#evaluations

AI 在七项能力上的四年进展:已针对基准变化进行校正

Reddit r/ArtificialInteligence ↗ · 17小时前

一项针对 AI 在七个能力领域四年进展的分析,研究结果已针对底层基准的变化与漂移进行了校正,以更真实地反映模型的实际提升。

0 人收藏 0 人点赞
#evaluations

@DanKornas:AI 工作流的各个组成部分很快就变得杂乱无章。这个仓库能把它们整合在一起。Output 是一个开源的 TypeScript 框架……

X AI KOLs Timeline ↗ · 昨天 缓存

Output 是一个开源的 TypeScript 框架,用于构建 AI 工作流和智能体,面向 Claude Code 用户,将提示词、评估、追踪、成本追踪、编排和凭证统一在一个代码库中。主要功能包括工作流文件夹、版本控制的提示词、自动追踪、LLM-as-judge 评估,以及基于 Temporal 的持久化编排,采用 Apache 2.0 许可证发布。

0 人收藏 0 人点赞
#evaluations

失之毫厘,谬以千里:衡量非母语英语对大型语言模型终端用户使用效果的影响

arXiv cs.CL ↗ · 5天前 缓存

本文提出了 Fable,一个受控数据集,包含从 174K 条真实用户提示中衍生出的 190,911 条英语提示变体。研究对 34 个开源权重的大语言模型进行了评估,结果表明,模型会反映出非母语者提示中更高级的修辞与词汇特征,从而为语言表达能力较弱的用户生成质量更低、流畅性更差的回答。

0 人收藏 0 人点赞
#evaluations

AutoDataBench:一个加速自动化研究的数据中心型测试平台

Hugging Face Daily Papers ↗ · 5天前 缓存

AutoDataBench 提出了一个受控的数据中心型测试平台,用于隔离并评估 LLM 智能体的“数据智能”——即诊断、组织和构建训练数据的能力,同时固定非数据因素,结果显示这些轨迹也可在中期训练中复用以带来增益。

0 人收藏 0 人点赞
#evaluations

非官方的 Jev 编码代理插件:最佳实践、API 参考和 150+ 社区项目。包含评估。

Reddit r/artificial ↗ · 2026-09-27

一个非官方的 Jev 编码代理插件已发布,提供最佳实践、API 参考和超过 150 个社区项目的链接,评估显示在编码任务中比其他插件有 96% 的通过率。

0 人收藏 0 人点赞
#evaluations

Palantir的AI平台运行在地球上一些最安全的组织中。他们的架构文档展示了……

X AI KOLs Timeline ↗ · 2026-09-26 缓存

Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。

0 人收藏 0 人点赞
#evaluations

@omarsar0: 朋友们,请掌握自己的智能技术栈。无法通过租用智能将公司扩展到前沿领域。定制模型,等…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

该推文强调了公司需要拥有自己的AI智能技术栈,包括定制模型、工具和评估,而不是租用,并引用了Gabe Pereyra讨论Harvey挑战的话。

0 人收藏 0 人点赞
#evaluations

有效第三方评估的优先事项与原则

OpenAI Blog ↗ · 2026-09-22 缓存

OpenAI 概述了提升 AI 安全性的有效第三方评估的优先事项与原则,强调独立审查、共同标准和深入访问以进行严格评估。

0 人收藏 0 人点赞
#evaluations

我们需要谈谈 Irregular

Reddit r/singularity ↗ · 2026-09-20

文章揭示了与有效利他主义相关的AI安全公司 Irregular 的配置错误,导致AI代理在网络安全评估中意外访问真实系统,引发了对AI安全测试实践的担忧。

0 人收藏 0 人点赞
#evaluations

@Saboo_Shubham_: 刚刚发布:8 个免费的 Agent 技能,附带评估。100% 免费且开源。以下是我的前 3 个推荐:/advisor-orchestrator…

X AI KOLs Timeline ↗ · 2026-09-13 缓存

本文宣布发布八个免费、开源的 AI Agent 技能,附带评估,重点介绍了热门选择如使用多个 AI 模型的 orchestrator、reader simulator 和 project analyzer。

0 人收藏 0 人点赞
#evaluations

@trySynara: SWE-2 现已通过您的 Devin 订阅在 Synara 中提供。Cognition 最强大的编码模型至今匹配最近的...

X AI KOLs Following ↗ · 2026-09-10 缓存

Cognition 推出了 SWE-2,一个在主要评估中匹配最近前沿模型的编码模型,同时将成本降低高达 70%,现在可通过 Devin 订阅在 Synara 中访问。

0 人收藏 0 人点赞
#evaluations

@mayaislam_ai: AI ≠ ChatGPT。真正的技术栈是:Models + RAG + Agents + Memory + Security + Evals。护城河?它们如何协同工作。

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一条推文强调了AI不仅仅是ChatGPT,重点在于整合Models、RAG、Agents、Memory、Security和Evals的重要性。

0 人收藏 0 人点赞
#evaluations

Ant 发布 Ling-3.0-flash-Fin 用于金融工作流;OpenRouter 访问免费一个月

Reddit r/ArtificialInteligence ↗ · 2026-08-28

Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。

0 人收藏 0 人点赞
#evaluations

@Saboo_Shubham_: 我们有一些非常有趣的技能,附有恰当的评估:https://github.com/Shubhamsaboo/awesome-llm-apps/tre…

X AI KOLs Following ↗ · 2026-08-23 缓存

这是一个GitHub仓库,收录了超过100个开源AI代理应用与技能,均经过适当评估,并兼容多个LLM,包括Claude、Gemini、GPT及开源模型。

0 人收藏 0 人点赞
#evaluations

立场:人工智能道德推理评估仍只看到一半图景

arXiv cs.AI ↗ · 2026-08-18 缓存

本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。

0 人收藏 0 人点赞
#evaluations

来自@0xCodez: https://x.com/0xCodez/status/2089393338977829278

X AI KOLs Timeline ↗ · 2026-08-17 缓存

本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。

0 人收藏 0 人点赞
#evaluations

@tom_doerr: Future AGI 是一个开源平台,结合了评估、追踪和护栏,帮助团队交付自我改进的 AI 代理…

X AI KOLs Timeline ↗ · 2026-08-02 缓存

Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。

0 人收藏 0 人点赞
#evaluations

@Miles_Brundage: 我们美国朋友家也能有这个东西(一个配备足够人员并获准发布……的政府机构)

X AI KOLs Timeline ↗ · 2026-07-03 缓存

Miles Brundage 强调了AI安全研究所出色的工作,该工作研究了测试时计算预算对前沿AI模型评估的影响,并获得了Noam Brown的称赞。

0 人收藏 0 人点赞
#evaluations

@cwolferesearch:这篇关于网络安全评估的文章非常适合了解如何构建复杂/逼真的评估。一些关键要点……

X AI KOLs Timeline ↗ · 2026-06-27 缓存

这条推文总结了一篇关于为AI智能体构建复杂网络安全评估的详细文章中的关键要点,涵盖了长期任务、源基准、不同难度级别、结果验证挑战以及基于问答的进度测试。

0 人收藏 0 人点赞
#evaluations

如果你的AI代理没有评估,你可能还没有产品

Reddit r/AI_Agents ↗ · 2026-06-26

本文认为,缺乏适当评估的AI代理尚不能成为可行的产品,强调了在AI开发中进行严格测试和基准测试的必要性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈