标签
Gabe Stengel 讨论了持久代理记忆作为企业中的一个主要未解决问题,重点关注记忆压缩以维持 AI 交互中的上下文和连贯性。
哈佛大学、MIT等实验室的一篇新论文介绍了FINSKILLOPS,这是一种方法,使金融AI代理能够持续从SEC文件错误中学习,同时使用回归测试来保持正确性并安全更新技能。
FINESSE是一个基于代理的模拟框架和基准数据集,用于生成合成的多模态金融事件序列,解决数据稀缺问题,并支持欺诈检测和余额预测等任务。
一则社交媒体帖子宣布本周将发布多款AI相关产品和模型,包括Images 2.5、GPT-Live-1、Agents API、Data Agent和ChatGPT for Financial Services,且在DevDay之前下周还有更多计划。
本文对比了Bloomberg和Thomson Reuters在AI模型开发上的不同策略,分析了从零训练大模型到在开放基座上微调的转变,以及这一趋势对垂直领域AI应用的影响。
本文研究了在合成限价订单簿数据上训练的大型语言模型是否能发展出准确的世界模型。研究发现,虽然这些模型能生成有效的序列,但存在系统性错误,导致有偏和虚假的预测。
这篇文章报告了对确定性AI金融验证引擎的基准测试结果,显示在结构化声明上表现完美(66/66),但当使用LLM生成的声明时表现不佳(19/66),表明LLM与形式系统之间存在翻译差距。
FinRCA-Bench是一个基准测试,旨在评估金融AI系统的证据检索和推理能力,为评估和改进提供标准化方法。
MINT 是一个框架,它将预训练的交易序列编码器连接到仅解码器的大语言模型,用于金融交易数据的零样本预测任务,在减少资源消耗的同时实现了最先进的性能。
Tavily promotes its web retrieval API for financial AI agents, highlighting use cases like real-time risk research, due diligence automation, and AML case work, with security features like zero data retention and prompt injection protection.
介绍了FinProBench,一个基于真实专业交付物衍生角色锚定评分标准来评估金融AI智能体的基准,并提出了RGRC流水线,该流水线改善了对角色专业化任务的评估。
本文介绍了DebtBench——首个针对催收协商的个性化基准测试,以及DebtGPT——一个同时优化财务回收与交互体验的催收代理。实验表明,大多数大型语言模型在这一真实场景中表现不佳,而DebtGPT达到了与GPT-4o相当的性能。
本文从内部审计视角提出了一种可解释的人工智能方法,用于检测银行交易异常,解决了金融安全系统中的可解释性和信任问题。
XAlpha引入了一种记忆驱动的AI量化研究员,它整合金融知识和发现反馈,自动完成从假设到代码的Alpha发现全流程,在沪深300上取得了更强的性能。
本文系统评估了信用评分中的拒绝推断方法,并发现了一种结构性失效模式:在自然的再训练周期中,模型的准确率提升但召回率骤降,造成了改进的幻象,而实际拒绝质量却在恶化。本文提出了一种受控探索策略,无需统计假设即可打破反馈循环,并证明即使最低的探索率也足以诊断该问题。
本文提出了一种统一的多模态框架,融合强化学习、高频交易、博弈论方法及跨模态情感分析,用于构建智能金融系统,并声称相比单领域系统有显著提升。
本文研究了LLM代理在金融交易中的行为对齐与表示动态,介绍了TradeArena测试平台,并发现规划嵌入中存在可测量的故障前特征,这些特征能在多种前沿模型与压力条件下高精度预测回撤。