这期最值得记的是一个反直觉的结果:把文字先渲染成图像,再作为视觉 token 喂给模型,六七百个文字 token 可以压缩成 64 个视觉 token,而还原出来的文字准确率仍然有 96%——压缩比十倍。
诺贝尔奖刚公布,一个有意思的统计:按获奖总人数算,Google 已经成为获得诺贝尔奖第二多的公司。
第一名是贝尔实验室。今天用的很多东西都是从那里出来的——鼠标之类,一长串。
有一条从官方媒体披露出来的旧案:2022 年针对授时中心的一次攻击被国家机关发现。
披露的细节里提到,攻击利用了某境外品牌手机的短信服务漏洞作为入口。
授时是很多关键系统的隐形依赖——攻击这一层,影响面比攻击某个具体业务系统大得多。而且这类行动往往是长期潜伏的。
这是当时被讨论最多的一篇。常规做法下,两千个字大致就是两千个 token。
这篇的做法是:把文字先转换成图像,输入模型的不再是 text token,而是 vision token。
结果是:输入六七百个文字 token 的内容,经过这套流程变成 64 个视觉 token,最终还原出来的文字准确率仍能到 96%——压缩比十倍。
原因也说得通:文字被编码成 token 之后是离散的、不连续的;而视觉 token 是连续的。从信息熵的角度看,连续编码天然能承载更高的信息密度。
所以这条路的诱惑很直接——让模型「读图」而不是「读字」,上下文成本可以整体下一个台阶。