Show HN: 两周的Hallucinate – 照片画廊
摘要
一个照片画廊,展示了两周内AI生成的幻觉图像,托管在hallucinate.site上。
暂无内容
查看缓存全文
缓存时间: 2026/06/13 14:38
# Hallucinate Gallery
来源:https://hallucinate.site/gallery
JOIN THE RAVE (https://hallucinate.site/)
加载中
相似文章
AI 自信犯错的程度远超人们想象,不服来辩
一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。
Gemma 和 Qwen 模型能否通过观察自己的 logprobs 来发现幻觉?
作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。
抽象摘要中关系级幻觉评估的基于依据的分解框架
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。
多模态大语言模型的统一幻觉模糊测试
本文介绍了UniHall,一个基于统一分类法的细粒度幻觉基准,以及自适多模态模糊测试(SAMF),一个用于多模态LLM的自进化压力测试框架。实验表明,最先进的模型在模糊测试下性能显著下降,并揭示了有用性与幻觉之间的权衡。
REIN:通过反思与弃权对齐弥合推理与可靠性之间的差距
本文介绍了REIN,一种对齐框架,通过训练大型推理模型在回答前进行明确反思,并在知识不足时主动弃权,从而减少幻觉。实验表明,REIN在多个基准上持续提升选择性准确率并减少幻觉。