标签
介绍了 Doc2DB-Bench,这是一个基准测试,用于评估基于 LLM 从长文档中提取关系数据库的能力,包含 42 个模式和七个领域的 203 个实例。
DataPrep-Bench是一个统一的基准测试,用于评估LLM在六个领域的训练数据构建和质量评估能力,包括一个技能引导的代理(Data-Construction-Skill)和一个基于分布的评估器(DAS),后者实现了强大的跨模型相关性。
DataEvolver是一个自进化多智能体框架,利用被拒绝样本的反馈迭代提升文本丰富图像生成的数据质量,在使用PixArt-alpha的TextScenesHQ上实现85.3%的OCR-F1提升,在LongTextBench上实现35.3%的提升。
本文介绍了CHILLGuard,一个基于新的5大类、31小类风险分类体系和可扩展多阶段数据构建流程的细粒度中文大模型内容安全护栏。该模型实现了最先进的性能,在F1分数上相比现有基线提升了15.92%。