标签
Last Translation Benchmark 推出了一个实时数据集,包含经同行评审的多模态示例,旨在评估并突破领先的机器翻译模型,并配有手工验证规则以确保可靠评估。它针对当前基准测试的饱和问题以及自动指标的不可靠性。
一项新的同行评审研究强调了在公民科学中使用人工智能时缺乏法律和伦理指导的关键问题,特别是关于训练数据的透明度,并提出了解决这一空白的建议。