guardrail

标签

Cards List
#guardrail

@alex_prompter: 这个开源代理无需改动一行代码就能降低你的AI agent成本。Plano位于你的agent和你的…

X AI KOLs Timeline · 2026-07-11 缓存

Plano是一个开源代理,位于AI agent和LLM提供商之间,通过智能路由、护栏过滤和成本感知选择来降低成本,所有配置通过单个YAML文件完成,无需修改agent代码。

0 人收藏 0 人点赞
#guardrail

DT-Guard: 意图驱动的推理主动训练实现免推理的LLM安全护栏

arXiv cs.AI · 2026-07-08 缓存

DT-Guard提出了一种推理主动训练、免推理推理的范式,用于LLM安全护栏。使用4B主干模型在安全基准测试中取得了强F1分数,超越更大的基线模型。

0 人收藏 0 人点赞
#guardrail

@AdinaYakup: 蚂蚁集团 @AntLingAGI 的 SingGuard 一个多模态护栏,其中安全策略作为输入,而非固定权重。 - ...

X AI KOLs Timeline · 2026-06-22 缓存

SingGuard 是蚂蚁集团的一款多模态护栏系统,将安全策略视为输入,支持通过自然语言进行动态调整。该产品采用 Apache 2.0 许可证,覆盖文本和图像模态。

0 人收藏 0 人点赞
#guardrail

SingGuard: 策略自适应多模态LLM护栏与动态推理

Hugging Face Daily Papers · 2026-06-22 缓存

SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#guardrail

CHILLGuard:面向细粒度中文大模型安全护栏的可扩展数据构建与模型感知偏好对齐

arXiv cs.CL · 2026-06-16 缓存

本文介绍了CHILLGuard,一个基于新的5大类、31小类风险分类体系和可扩展多阶段数据构建流程的细粒度中文大模型内容安全护栏。该模型实现了最先进的性能,在F1分数上相比现有基线提升了15.92%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈