我们构建了一个评分模型,评估的是演讲表达而非仅文稿,以下是它在真实演讲中发现的内容

Reddit r/ArtificialInteligence 产品

摘要

一个使用Inter-1实时评分演讲表达信号(自信、犹豫、能量)及内容分数的产品演示,在真实演讲中测试时,它捕捉到了一次关于牵引力数据的犹豫。

继我们之前的Inter-1流式工作之后(部分读者可能看过我们早前关于发现幻觉错误的文章)。这次是一个产品演示而非研究论文。核心思路:基于文稿的演讲评分无法区分自信陈述和委婉陈述,因为纸面上的文字可以完全相同。“我们每月增长40%”无论你信不信,读起来都一样。我们构建了一个演示,将视频实时传输到Inter-1,并评分表达信号(自信、犹豫、能量)和内容分数,每个信号都与其发生的具体时刻绑定。我用我自己的演讲进行了测试。内容得分87分。表达捕捉到了一次犹豫,正好落在牵引力数据上,自信度50分,总分降至80分。更多详情请点击:https://www.interhuman.ai/blog/pitch-practice-demo
查看原文

相似文章

PitchDrop.ai

Product Hunt

PitchDrop.ai 是一款全新的人工智能驱动工具,旨在作为演示文稿的提案顾问。

1752vc Pitch Deck 分析器

Product Hunt

1752vc Pitch Deck 分析器提供AI驱动的反馈,针对初创企业路演演示文稿,基于超过25,000份真实演示文稿训练,帮助创业者在联系投资者之前识别可融资性问题。

xPitch

Product Hunt

xPitch是一款为休闲球员提供足球比赛分析的移动应用,类似于足球界的Strava。

@josephdecker: 我的16款模型评测中,冠军在审计中被发现编造了5次。第二名仅差0.1分,零编造……

X AI KOLs Timeline

Joseph Decker 为他的产品 Condensr 评估了16个AI模型的真实性,发现排行榜冠军在审计中五次编造内容,于是转而部署了零编造的第二名模型。这篇文章详细介绍了评估过程、LLM判断器中的一个漏洞(由于截断的转录而惩罚了准确的摘要),以及自定义评估优于通用基准的重要性。