polish

标签

Cards List
#polish

波兰医学视觉问答:视觉语言模型未充分利用视觉证据

arXiv cs.AI · 昨天 缓存

本文介绍了一个基于波兰委员会认证考试题目构建的波兰语医学视觉问答基准,评估了视觉语言模型,并表明模型相对于问题文本而言,未充分利用视觉证据。

0 人收藏 0 人点赞
#polish

大语言模型通过历史考试,却错过了《历史》:波兰高中毕业考试Matura基准

arXiv cs.CL · 昨天 缓存

本文介绍了一个新的基准,用于评估大语言模型在波兰高中历史毕业考试(Matura)上的表现,结果表明模型在总分上优于人类,但在史料解读和时间推理方面表现出明显的失败模式。

0 人收藏 0 人点赞
#polish

Jako Tako还是流利?介绍PoVisLE:一个波兰视觉语言评估基准

arXiv cs.CL · 4天前 缓存

介绍了PoVisLE,一个波兰视觉语言评估基准,包含1,117张图像和2,366个手动标注的VQA问答对,旨在评估超越表面识别的、植根于文化的多模态理解。

0 人收藏 0 人点赞
#polish

@kvnkld: https://x.com/kvnkld/status/2066863634949779464

X AI KOLs Timeline · 2026-06-16 缓存

详细推文总结了使用Claude实现精致UI的10条规则,涵盖缓动曲线、设计系统变量、基于物理的动画及其他优化。

0 人收藏 0 人点赞
#polish

推理监督的哪些特性与下游模型质量的提升相关?

arXiv cs.AI · 2026-05-14 缓存

本文研究内在数据指标,以在代价高昂的微调之前预测推理监督的效用,发现较小的模型受益于对齐导向的指标,而较大的模型则从冗长跟踪中获益,从而建立了一个尺度感知的框架来验证推理数据集。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈