behavioral-testing

标签

Cards List
#behavioral-testing

GameASG-Bench:游戏开发中自主软件生成基准测试

arXiv cs.AI ↗ · 2026-09-21 缓存

GameASG-Bench 是一个用于评估游戏开发中自主软件生成系统的基准测试平台,它通过静态与运行时检查来纳入行为可测试性。

0 人收藏 0 人点赞
#behavioral-testing

SchemeArena:LLM代理中诡计行为的分解压力测试

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

SchemeArena是一个框架,通过改变目标、监督等因素,系统化测试LLM代理中的诡计行为,发现拥有自身目标的代理更易实施诡计,并引入SCOUT用于监控推理和行为。

0 人收藏 0 人点赞
#behavioral-testing

产品开发正在被重塑

Hacker News Top ↗ · 2026-08-26 缓存

本文探讨了编程代理和大型语言模型的进步如何引发传统产品开发流程的重写,从顺序循环转变为基于实证和意图的循环,专注于行为结果。

0 人收藏 0 人点赞
#behavioral-testing

立场:行为系统需要行为测试

arXiv cs.AI ↗ · 2026-08-20 缓存

本文立场论文认为,AI代理必须像行为系统一样,通过系统观察和测试其过程,而不仅仅是性能结果来进行评估,并提出了一个研究议程,以开发严格的行为测试,以增进理解和确保安全。

0 人收藏 0 人点赞
#behavioral-testing

@no_stp_on_snek: Qwen3.8 27B 概览。版本 3.6:退步:* 偏见/公平性 * 配置易用性 增强:* 核心 * 能力 结论…

X AI KOLs Timeline ↗ · 2026-08-14 缓存

本文评估了Qwen3.8 27B AI模型的3.6版本,强调了在偏见/公平性和配置易用性方面的退步,同时指出了在核心和能力方面的改进,得出结论:这不是一次干净的升级。

0 人收藏 0 人点赞
#behavioral-testing

@no_stp_on_snek: qwen 3.8 27b 的一些最新发现: https://x.com/i/broadcasts/1MJgNbbqqAbGL…

X AI KOLs Timeline ↗ · 2026-08-14 缓存

由 Tom Turney 主持的直播介绍了 Qwen 3.8 27b AI 模型的最新行为测试发现。

0 人收藏 0 人点赞
#behavioral-testing

@no_stp_on_snek: https://github.com/TheTom/offlabel/blob/main/models/qwen3.8-27b.md… 初步非官方指南

X AI KOLs Timeline ↗ · 2026-08-14 缓存

offlabel GitHub仓库提供实用的、基于证据的AI模型操作指南,专注于实际行为和用法提示,而非基准分数。

0 人收藏 0 人点赞
#behavioral-testing

@MichaelGannotti: 应用 offlabel 指南:使用社区验证的行为测试强化 Laguna S 2.1 — offlabel 项目发布……

X AI KOLs Timeline ↗ · 2026-07-26

offlabel 项目发布了 Laguna S 2.1 的 261 行行为评估,其中包含四个配置要求,经过三个独立栈的验证。该指南被应用于更新五个文件,并详细说明了更改内容和原因。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈