@BenjaminDEKR: Jev能理解基本形状吗?某种程度上可以。Jev是纯文本的,完全没有图像输入。所以我作弊了。将形状渲染到一个64…

X AI KOLs Following 新闻

摘要

一个实验测试了纯文本AI模型通过将图像转换为Unicode盲文文本识别形状的能力,实现了略高于随机猜测的准确率,但置信度估计可靠。

Jev能理解基本形状吗? 某种程度上可以。 Jev是纯文本的,完全没有图像输入。 所以我作弊了。将形状渲染到一个64×64的画布上,进行阈值处理,然后将每2×4像素块打包成一个Unicode盲文字符。图片变成了512个字符的纯文本,Jev可以读取。 然后问它:12选1。 12个中4个正确。随机概率是8%。 所以它确实在读取一些东西(4倍于随机概率),但有三分之二的时间是错的。 好的部分是它知道什么时候:它以0.25的置信度将字母S误认为是圆,然后以0.41的置信度正确识别了字母T。即使在准确性不足的情况下,校准仍然成立。 整个运行:12次调用,每次190毫秒,0.0007美元。
查看原文
查看缓存全文

缓存时间: 2026/09/21 05:23

Jev能理解基本形状吗? 勉强算可以。

Jev是纯文本模型,完全无法处理图像。

于是我取了个巧:先把形状渲染到64×64画布上,进行二值化处理,再将每2×4像素块打包成一个Unicode盲文字符。最终图片就变成了512个纯文本字符——这样Jev就能“阅读“了。

然后让它回答:12选1的识别任务。 正确率4/12,随机猜测的概率是8%。

这说明它确实识别出了某些特征(正确率是随机猜测的四倍),但三分之二的情况仍会出错。

可贵之处在于它具有置信度校准能力:比如将字母S识别为圆形时仅给出0.25的置信度,而正确识别字母T时置信度达到0.41。即便在准确率不高的情况下,概率校准依然保持有效。

完整测试:12次调用,每次耗时190毫秒,总成本0.0007美元。

相似文章

从文本决策到像素:Jev-Style视觉选择模型研究

arXiv cs.AI

PixelJev被介绍为一种原生图像决策接口,使用小型开放多模态模型将图像、指令和候选集映射到结构化选择。该研究表明,在Pets等基准测试中,自适应提高了准确性,并突出了校准和泛化方面的挑战。

Jev-like逆向工程模型

Hacker News Top

本文介绍了'jevlike',一个用于在一次传递中从文本选项中选择的逆向工程AI模型,有演示如Doom和国际象棋游戏,托管在GitHub上。

我将 Qwen3.8-27B Q2_64 + llama.cpp 转换为一个完全 TypeSafe AI 兼容的 Jev 风格系统。OpenAI API 仍然完整!全球首个支持视觉的 Jev 风格模型!显存占用低于 10 GB,在 RTX 3090 上延迟 170 毫秒,聊天速度约 140 tok/s。在包含 22,000 个请求的多样化类型决策基准测试中,准确率为 76%,而 Jev-1.13 为 88%。

Reddit r/LocalLLaMA

Bonsai-Llama-Jev 是一个开源的、支持视觉的类型决策推理系统,可在本地运行,具有低显存占用和高准确率,在多样化基准测试中超越其他系统。