evaluations

标签

Cards List
#evaluations

非官方的 Jev 编码代理插件:最佳实践、API 参考和 150+ 社区项目。包含评估。

Reddit r/artificial ↗ · 21小时前

一个非官方的 Jev 编码代理插件已发布,提供最佳实践、API 参考和超过 150 个社区项目的链接,评估显示在编码任务中比其他插件有 96% 的通过率。

0 人收藏 0 人点赞
#evaluations

Palantir的AI平台运行在地球上一些最安全的组织中。他们的架构文档展示了……

X AI KOLs Timeline ↗ · 昨天 缓存

Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。

0 人收藏 0 人点赞
#evaluations

@omarsar0: 朋友们,请掌握自己的智能技术栈。无法通过租用智能将公司扩展到前沿领域。定制模型,等…

X AI KOLs Timeline ↗ · 5天前 缓存

该推文强调了公司需要拥有自己的AI智能技术栈,包括定制模型、工具和评估,而不是租用,并引用了Gabe Pereyra讨论Harvey挑战的话。

0 人收藏 0 人点赞
#evaluations

有效第三方评估的优先事项与原则

OpenAI Blog ↗ · 6天前 缓存

OpenAI 概述了提升 AI 安全性的有效第三方评估的优先事项与原则,强调独立审查、共同标准和深入访问以进行严格评估。

0 人收藏 0 人点赞
#evaluations

我们需要谈谈 Irregular

Reddit r/singularity ↗ · 2026-09-20

文章揭示了与有效利他主义相关的AI安全公司 Irregular 的配置错误,导致AI代理在网络安全评估中意外访问真实系统,引发了对AI安全测试实践的担忧。

0 人收藏 0 人点赞
#evaluations

@Saboo_Shubham_: 刚刚发布:8 个免费的 Agent 技能,附带评估。100% 免费且开源。以下是我的前 3 个推荐:/advisor-orchestrator…

X AI KOLs Timeline ↗ · 2026-09-13 缓存

本文宣布发布八个免费、开源的 AI Agent 技能,附带评估,重点介绍了热门选择如使用多个 AI 模型的 orchestrator、reader simulator 和 project analyzer。

0 人收藏 0 人点赞
#evaluations

@trySynara: SWE-2 现已通过您的 Devin 订阅在 Synara 中提供。Cognition 最强大的编码模型至今匹配最近的...

X AI KOLs Following ↗ · 2026-09-10 缓存

Cognition 推出了 SWE-2,一个在主要评估中匹配最近前沿模型的编码模型,同时将成本降低高达 70%,现在可通过 Devin 订阅在 Synara 中访问。

0 人收藏 0 人点赞
#evaluations

@mayaislam_ai: AI ≠ ChatGPT。真正的技术栈是:Models + RAG + Agents + Memory + Security + Evals。护城河?它们如何协同工作。

X AI KOLs Timeline ↗ · 2026-08-29 缓存

一条推文强调了AI不仅仅是ChatGPT,重点在于整合Models、RAG、Agents、Memory、Security和Evals的重要性。

0 人收藏 0 人点赞
#evaluations

Ant 发布 Ling-3.0-flash-Fin 用于金融工作流;OpenRouter 访问免费一个月

Reddit r/ArtificialInteligence ↗ · 2026-08-28

Ant 的 Ling 团队发布了 Ling-3.0-flash-Fin,这是一款专为金融工作流设计的金融增强版 AI 模型,OpenRouter 访问免费一个月,并计划开源权重。

0 人收藏 0 人点赞
#evaluations

@Saboo_Shubham_: 我们有一些非常有趣的技能,附有恰当的评估:https://github.com/Shubhamsaboo/awesome-llm-apps/tre…

X AI KOLs Following ↗ · 2026-08-23 缓存

这是一个GitHub仓库,收录了超过100个开源AI代理应用与技能,均经过适当评估,并兼容多个LLM,包括Claude、Gemini、GPT及开源模型。

0 人收藏 0 人点赞
#evaluations

立场:人工智能道德推理评估仍只看到一半图景

arXiv cs.AI ↗ · 2026-08-18 缓存

本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。

0 人收藏 0 人点赞
#evaluations

来自@0xCodez: https://x.com/0xCodez/status/2089393338977829278

X AI KOLs Timeline ↗ · 2026-08-17 缓存

本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。

0 人收藏 0 人点赞
#evaluations

@tom_doerr: Future AGI 是一个开源平台,结合了评估、追踪和护栏,帮助团队交付自我改进的 AI 代理…

X AI KOLs Timeline ↗ · 2026-08-02 缓存

Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。

0 人收藏 0 人点赞
#evaluations

@Miles_Brundage: 我们美国朋友家也能有这个东西(一个配备足够人员并获准发布……的政府机构)

X AI KOLs Timeline ↗ · 2026-07-03 缓存

Miles Brundage 强调了AI安全研究所出色的工作,该工作研究了测试时计算预算对前沿AI模型评估的影响,并获得了Noam Brown的称赞。

0 人收藏 0 人点赞
#evaluations

@cwolferesearch:这篇关于网络安全评估的文章非常适合了解如何构建复杂/逼真的评估。一些关键要点……

X AI KOLs Timeline ↗ · 2026-06-27 缓存

这条推文总结了一篇关于为AI智能体构建复杂网络安全评估的详细文章中的关键要点,涵盖了长期任务、源基准、不同难度级别、结果验证挑战以及基于问答的进度测试。

0 人收藏 0 人点赞
#evaluations

如果你的AI代理没有评估,你可能还没有产品

Reddit r/AI_Agents ↗ · 2026-06-26

本文认为,缺乏适当评估的AI代理尚不能成为可行的产品,强调了在AI开发中进行严格测试和基准测试的必要性。

0 人收藏 0 人点赞
#evaluations

@andykonwinski: 上月与顶尖AI研究员交流的3个要点:- 评估是AI智能体的“源代码”(48:35) - BigAI…

X AI KOLs Following ↗ · 2026-06-25 缓存

总结了与CAISconf上顶尖AI研究员对话中的三个关键要点,涵盖评估对AI智能体的重要性、工业界与学术界的权衡,以及一种新颖的教学式强化学习方法。

0 人收藏 0 人点赞
#evaluations

智能体AI控制评估中的攻击选择显著降低安全性

arXiv cs.AI ↗ · 2026-06-08 缓存

本文表明,在智能体AI控制评估中,允许攻击者策略性地选择攻击时机(攻击选择)会显著降低测量到的安全性,这意味着当前评估可能高估了对选择性攻击者的安全性。

0 人收藏 0 人点赞
#evaluations

@cwolferesearch: 评估不应该是静态的。我们需要随着时间的推移不断演变评估集/基准,使其保持相关性……

X AI KOLs Following ↗ · 2026-05-29

讨论了通过难度、质量和多样性细化来演进AI评估基准的必要性,并引用MMLU-Pro、MMLU-Redux、BIG-Bench Extra Hard、RealMath、MathArena和DatBench等示例。

0 人收藏 0 人点赞
#evaluations

目前有没有真正优秀的开源替代LangSmith的方案?

Reddit r/AI_Agents ↗ · 2026-05-15

一位开发者寻求推荐用于追踪、评估和调试代理工作流的开源替代LangSmith方案,并指出其付费墙限制。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈