标签
一个团队观察到,在同一周内,自动评估分数和用户点踩率都上升了,这表明客观指标与用户满意度之间存在不匹配。
用户jakevin7认为SKILLS管理存在问题,不建议全局安装,只适合临时读取和分发。
Thunderbird 分享了关于桌面设置的用户研究发现,重点强调了信任、减少杂乱和导航挑战等关键主题,并概述了计划中的改进,例如更清晰的语言和精简的信息架构。
一位用户对 ChatGPT 的新桌面 UI 表达了不满,认为它过度简化了聊天界面,同时将 Codex 作为重点,并且缺少了用于组织的文件夹;询问其他人是否有同感。
Artillain 称赞 CLine 团队在他提交反馈和日志后修复了性能问题,并指出他们绕过了 IDE 的内部机制。
来自aiDotEngineer大会第一天的笔记,聚焦Kent Dodds关于AI时代产品工程的主题演讲。核心观点:当AI将实现过程商品化时,产品判断力成为最后需要掌握的技能。涵盖Arrow Metaphor、产品工程师与产品经理的区别、验证技巧(如The Mom Test)、Jobs-to-Be-Done Framework、用于功能优先级排序的Kano Model以及用户反馈循环。
Correl8 AI 是一个 MCP 工具,让 AI 代理能够直接报告有意义的用户反馈,比如错误、困惑和功能请求,帮助团队在不查看所有聊天记录的情况下发现产品信号。
本文对集成在电子健康记录中的LLM系统进行了以部署为中心的评估,训练了一个分类器,利用提供者类型和科室等响应前上下文来预测查询级拒绝风险,在4.5个月的反馈中实现了0.719的AUROC。
用户抱怨功能缺失和可用性问题后,AcuRite推迟了从My AcuRite强制迁移至AcuRite NOW的计划。
本文介绍了MemToolAgent,一个通过集成存储和检索过去经验的记忆系统来增强LLM代理工具使用能力的框架,在多个基准测试上取得了显著改进,且无需对模型进行微调。
一位用户在社交媒体上抱怨,在 Claude Code 的付费计划下迅速触达使用限额,并批评 Anthropic 对待用户的方式。
Anthropic 正通过专属办公时间,收集用户对 Claude Code 云端版在桌面、iOS 和 Android 平台上的反馈。
OpenAI announces an update focused on making model responses more concise, based on user feedback.
网友质疑阶跃星辰过早推进商业化,同时称赞小米 Mimo 的 AI 写代码体验优于或持平 Claude,速度更快。
WildFeedback是一个新颖的框架,它利用真实LLM对话中的原位用户反馈来自动创建偏好数据集,用于将语言模型与人类偏好对齐,解决了传统基于标注的对齐方法中的可扩展性和偏差问题。