@BenjaminDEKR: Jev能理解基本形状吗?某种程度上可以。Jev是纯文本的,完全没有图像输入。所以我作弊了。将形状渲染到一个64…
摘要
一个实验测试了纯文本AI模型通过将图像转换为Unicode盲文文本识别形状的能力,实现了略高于随机猜测的准确率,但置信度估计可靠。
查看缓存全文
缓存时间: 2026/09/21 05:23
Jev能理解基本形状吗? 勉强算可以。
Jev是纯文本模型,完全无法处理图像。
于是我取了个巧:先把形状渲染到64×64画布上,进行二值化处理,再将每2×4像素块打包成一个Unicode盲文字符。最终图片就变成了512个纯文本字符——这样Jev就能“阅读“了。
然后让它回答:12选1的识别任务。 正确率4/12,随机猜测的概率是8%。
这说明它确实识别出了某些特征(正确率是随机猜测的四倍),但三分之二的情况仍会出错。
可贵之处在于它具有置信度校准能力:比如将字母S识别为圆形时仅给出0.25的置信度,而正确识别字母T时置信度达到0.41。即便在准确率不高的情况下,概率校准依然保持有效。
完整测试:12次调用,每次耗时190毫秒,总成本0.0007美元。
相似文章
@BenjaminDEKR: Jev能解决迷宫吗?我给了它一个14×14的编织迷宫:随机化Prim算法,约52个交叉点,通过死胡同打通了回路……
一项实验测试了AI模型Jev解决编织迷宫的能力,发现将状态管理转移到JavaScript减少了模型调用次数,并实现了迷宫的成功解决。
从文本决策到像素:Jev-Style视觉选择模型研究
PixelJev被介绍为一种原生图像决策接口,使用小型开放多模态模型将图像、指令和候选集映射到结构化选择。该研究表明,在Pets等基准测试中,自适应提高了准确性,并突出了校准和泛化方面的挑战。
@0xLogicrw: This is probably the project that's expanded Jev's imaginative scope the most of anything I've seen so far. Once AI bec…
Vercel Labs engineer Chris Tate is experimenting with integrating Jev into json-render to enable AI to compose UI components at runtime, expanding creative possibilities as AI becomes faster and cheaper.
Jev-like逆向工程模型
本文介绍了'jevlike',一个用于在一次传递中从文本选项中选择的逆向工程AI模型,有演示如Doom和国际象棋游戏,托管在GitHub上。
我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。
Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。