ai-interpretability

标签

Cards List
#ai-interpretability

Gemma Scope 2:助力AI安全社区深入理解复杂的语言模型行为

Google DeepMind Blog · 2025-12-16 缓存

DeepMind发布Gemma Scope 2,这是一套面向Gemma 3模型家族的开放可解释性工具套件,旨在帮助AI安全社区理解和调试幻觉、越狱等复杂的语言模型行为。

0 人收藏 0 人点赞
#ai-interpretability

Understanding the inner thoughts of AI

YouTube AI Channels · 2026-07-11 缓存

本文讨论了人工智能可解释性的重要性,重点介绍了思维链推理作为理解神经网络内部工作原理的工具,并分析了其当前的有效性、局限性以及未来更强大模型可能带来的解读挑战。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈