标签
本文介绍了一个基于波兰委员会认证考试题目构建的波兰语医学视觉问答基准,评估了视觉语言模型,并表明模型相对于问题文本而言,未充分利用视觉证据。
本文介绍了一个新的基准,用于评估大语言模型在波兰高中历史毕业考试(Matura)上的表现,结果表明模型在总分上优于人类,但在史料解读和时间推理方面表现出明显的失败模式。
介绍了PoVisLE,一个波兰视觉语言评估基准,包含1,117张图像和2,366个手动标注的VQA问答对,旨在评估超越表面识别的、植根于文化的多模态理解。
详细推文总结了使用Claude实现精致UI的10条规则,涵盖缓动曲线、设计系统变量、基于物理的动画及其他优化。
本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。