EP.58 · 2025-10-24
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 10 月当时的判断,未按后来的发展修改。
2025-10-24 · 62 分钟 · 逐话题

把文字先变成图,token 能压掉十倍

这期最值得记的是一个反直觉的结果:把文字先渲染成图像,再作为视觉 token 喂给模型,六七百个文字 token 可以压缩成 64 个视觉 token,而还原出来的文字准确率仍然有 96%——压缩比十倍。

本期话题
  1. 按人数算,Google 已经是拿诺奖第二多的公司
  2. 针对授时中心的那次攻击
  3. 文字变成图,压缩比到十倍
01

按人数算,Google 已经是拿诺奖第二多的公司

诺贝尔奖刚公布,一个有意思的统计:按获奖总人数算,Google 已经成为获得诺贝尔奖第二多的公司。

第一名是贝尔实验室今天用的很多东西都是从那里出来的——鼠标之类,一长串。

02

针对授时中心的那次攻击

有一条从官方媒体披露出来的旧案:2022 年针对授时中心的一次攻击被国家机关发现。

披露的细节里提到,攻击利用了某境外品牌手机的短信服务漏洞作为入口。

授时是很多关键系统的隐形依赖——攻击这一层,影响面比攻击某个具体业务系统大得多。而且这类行动往往是长期潜伏的。

03

文字变成图,压缩比到十倍

这是当时被讨论最多的一篇。常规做法下,两千个字大致就是两千个 token

这篇的做法是:把文字先转换成图像,输入模型的不再是 text token,而是 vision token。

结果是:输入六七百个文字 token 的内容,经过这套流程变成 64 个视觉 token,最终还原出来的文字准确率仍能到 96%——压缩比十倍。

原因也说得通:文字被编码成 token 之后是离散的、不连续的;而视觉 token 是连续的。从信息熵的角度看,连续编码天然能承载更高的信息密度。

所以这条路的诱惑很直接——让模型「读图」而不是「读字」,上下文成本可以整体下一个台阶。

每周 AI 情报 · AI Buzzwords · EP.58 · 2025-10-24 · 1 小时 2 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾