accuracy

标签

Cards List
#accuracy

AI卡路里计数应用到底有多准确?没人告诉你的真相

Reddit r/AI_Agents · 3天前

一篇文章探讨AI驱动的卡路里计数应用的真实准确性,并揭示未公开的局限性。

0 人收藏 0 人点赞
#accuracy

我的联邦学习项目刚刚表明,“高准确率”可以完全掩盖模型遗漏整个类别中每一个攻击的情况,我认为更多人应该了解这一点[R]

Reddit r/MachineLearning · 3天前

一个联邦学习研究项目揭示,全局准确率可能掩盖网络入侵检测中少数攻击类别的灾难性失败,表明每个客户端的性能及聚合方法的选择对于罕见攻击检测至关重要。

0 人收藏 0 人点赞
#accuracy

我的同事让他的人工智能代理在他“没空”时自动回复Slack消息。结果并不顺利。

Reddit r/AI_Agents · 2026-07-14

一名员工使用人工智能代理自动回复Slack消息,该代理在客户截止日期问题上给出了一个自信但完全错误的答案,这凸显了信赖语气和流畅性而非准确性的风险。

0 人收藏 0 人点赞
#accuracy

@KanikaBK: 微软刚刚投下了一枚重磅炸弹。他们让ChatGPT的准确率从41%跃升至80%,却没有动一个参数。这……

X AI KOLs Timeline · 2026-07-10 缓存

微软的SkillOpt系统通过将AI的技能文档视为一个从自身失败中学习的活模型,使ChatGPT准确率从41%提升至80%,在多个基准测试中取得了显著提升,且推理时零开销。

0 人收藏 0 人点赞
#accuracy

FTC试图将AI的“准确性”定义为消费者保护问题。谁有权定义真实的答案?

Reddit r/ArtificialInteligence · 2026-07-10

FTC正试图将AI准确性界定为消费者保护问题,这引发了关于谁来决定AI系统给出的真实答案是什么的疑问。

0 人收藏 0 人点赞
#accuracy

提升Genie Space的准确性

Reddit r/AI_Agents · 2026-07-09

本文讨论了如何提升Genie Space的准确性,可能涉及新技术或模型更新。

0 人收藏 0 人点赞
#accuracy

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL · 2026-07-09 缓存

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

0 人收藏 0 人点赞
#accuracy

你能信任本地模型准确回答吗?

Reddit r/LocalLLaMA · 2026-07-08

探讨在本地运行AI模型的可靠性和准确性,质疑用户能否信任其输出。

0 人收藏 0 人点赞
#accuracy

Genie Ontology 如何真正提高 text-to-SQL 准确率——机制而非宣传

Reddit r/AI_Agents · 2026-07-07

本文解释了 Genie Ontology 方法如何通过关注底层机制而非营销宣传来提高 text-to-SQL 准确率。

0 人收藏 0 人点赞
#accuracy

@linghaokong76: 网络能否在不增加非零权重的情况下表现更好?我们的ICML 2026论文指出:将相同的活跃权重分散到更多神经元上…

X AI KOLs Timeline · 2026-07-06 缓存

一篇新的ICML 2026论文表明,将相同的活跃权重分散到更多神经元上可以减少冲突并提高精度,这表明网络可以在不增加非零权重的情况下表现更好。

0 人收藏 0 人点赞
#accuracy

哪款免费AI工具能为视频提供最准确的字幕?

Reddit r/AI_Agents · 2026-07-02

比较用于生成准确视频字幕的免费AI工具。

0 人收藏 0 人点赞
#accuracy

准确度让我措手不及

Reddit r/singularity · 2026-06-30

文章讨论了一个AI模型出乎意料的高准确度,突出了其令人印象深刻的表现。

0 人收藏 0 人点赞
#accuracy

@VikParuchuri: Datalab 平衡模式提取现已在内部基准测试中达到 95.9% 的准确率——比 Reducto Deep Extract 更精准(…

X AI KOLs Timeline · 2026-06-27 缓存

Datalab 的平衡模式提取在内部基准测试中实现了 95.9% 的准确率,超越 Reducto Deep Extract(95.1%),而价格不到其一半,并提供包含引用和推理的完整验证。

0 人收藏 0 人点赞
#accuracy

有时,健康追踪的准确性被高估了

The Verge · 2026-06-26 缓存

Verge高级评测员Victoria Song分享了她对消费级智能秤和体成分测量不准确的沮丧体验,将其与临床DEXA扫描进行对比,并认为绝对精准对健康追踪而言可能并非必要。

0 人收藏 0 人点赞
#accuracy

研究:采用治理方法的LLM Wiki达到97%准确率,成本仅为三分之一——埃默里大学与IBM研究院合作

Reddit r/ArtificialInteligence · 2026-06-25 缓存

埃默里大学与IBM研究院的一项研究提出了一种可验证的上下文治理方法,用于大语言模型,实现了97%的准确率,而成本仅为原来的三分之一。

0 人收藏 0 人点赞
#accuracy

@VikParuchuri: 我们正在推出 turbo mode 数据提取——比 Azure Content Understanding 快 5 倍、便宜 5 倍,且准确度高 7%……

X AI KOLs Following · 2026-06-17 缓存

VikParuchuri 宣布推出 turbo mode 数据提取,声称速度比 Azure Content Understanding 快 5 倍,成本低 5 倍,准确度提高 7%,并且实现了具有竞争力的延迟,适用于实时工作流。

0 人收藏 0 人点赞
#accuracy

目前AI语音代理面临的最大问题是什么?

Reddit r/AI_Agents · 2026-06-12

讨论AI语音代理在真实客户交互中面临的主要挑战,如口音处理、延迟和集成,并邀请企业分享经验。

0 人收藏 0 人点赞
#accuracy

一些测试不同Gemma和Qwen量化版本准确性的对比实验

Reddit r/LocalLLaMA · 2026-06-12

一位用户分享了针对不同量化版本的Gemma和Qwen模型在算术、总统出生日期和注意力测试中的准确率对比基准结果,强调了模型规模与量化级别之间的权衡。

0 人收藏 0 人点赞
#accuracy

@bnjmn_marie:对于LFM2.5 8B A1B,MoQ GGUFs是最好的,它们拥有最佳的精度/大小比。再次,看到……

X AI KOLs Following · 2026-06-08 缓存

帖子作者指出,LFM2.5 8B A1B模型的MoQ GGUFs提供了最佳的精度/大小比,并建议不要使用精度恢复低于95%的版本。

0 人收藏 0 人点赞
#accuracy

@PrajwalTomar_: 这篇Reddit帖子刚刚发布了一个Claude Code技巧,能让你首次尝试的准确率从70%提升到90%。一位开发者……

X AI KOLs Following · 2026-06-08 缓存

一篇Reddit帖子介绍了一个名为/grill-me的Claude Code技巧,它通过迭代提问从用户那里提取所有上下文,并将决策保存到知识文档中,使初始准确率从70%提升到90%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈