标签
Chamath发现通过SEC财报文件中热词频率的变化可以预判概念是否即将退潮,例如DEI在2020-2022年达到顶峰后下滑,而AI自2022年底持续上升,目前几乎每家大公司财报都在提及。
本文提出一个基于大语言模型(LLM)的两阶段系统,利用包含119种事件类型的三层分类法,从SEC 8-K文件中提取可溯事件标签,并具备约束与可审计机制。该系统在近30万份文件上进行了评估,在高质标签上展现出高精确度,并支持区分经济意义上不同事件的事件研究。
一个实用的解决方案,使用AnySearch让本地AI代理高效查询多个专业来源(CVE、SEC申报),返回结构化JSON/Markdown,避免速率限制和破损的SDK。
来自斯坦福大学、加州大学和南京大学的研究人员发布了SEFD数据集,包含来自SEC文件的152B个词元,转换为保留布局的MultiMarkdown格式,保持表格结构用于LLM训练,且与Common Crawl的重叠很小。
开源了一组用于 Codex 平台的买方研报 skill,可从 SEC 官方拉取原始文件进行分析,支持多种投资研究框架。
介绍Equibles,一个自托管开源MCP服务器,为本地LLM提供实时美国金融数据,包括SEC文件、内幕交易和经济指标。