Probes & Culture

实验与文化

自己动手做的评测、探针实验,以及 AI 时代的文化观察。
17 篇文章。

评测与实验 8

  1. AI 黑话指数:11 家大模型厂商官方 Blog 用词复杂度全测评

    对 OpenAI、Anthropic、DeepMind、Meta、Microsoft 等 11 家厂商 178 篇官方 Blog 做可读性、黑话密度量化分析:DeepMind 最难读,DeepSeek 读起来最轻松但黑话密度最高

  2. Vibe Genomics:一个零实验室经验的人,用 Claude 在家测了自己的全基因组

    一个自称零实验室经验的人,靠 Claude 实时指导在家用约一万美元设备完成全基因组测序、对齐 23andMe 数据达 99.25% 准确率的公民科学实验

  3. LLM 能画出胎儿分娩机转吗?8 个模型的 SVG 医学画图测试

    仿照「鹈鹕骑自行车」测试的精神,让 8 个 LLM 画分娩机转 SVG 示意图并盲评打分——一次轻松但认真的实验,没有模型画对解剖结构

  4. 一碗豆腐脑,撬开 AI 的黑盒 · 从口味偏好到可解释性

    🥣 粽子续集,加测「豆腐脑甜还是咸」并追问这到底是不是模型的「真实偏好」· 同一模型跨题口味常对不上(8/17 翻盘)、没有稳定的「口味人格」· 四层可解释性阶梯:行为采样 → logprobs → 可操控性 → 机理层 · 结论:想看得越深,模型就得越开放

  5. AI 的甜咸之争 · 从一颗粽子看模型的「偏好」

    🫔 17 个头部模型各问 20 次「甜粽还是咸粽」:Opus 4.8 全咸、腾讯混元全甜、GLM-5.2 偏甜 · 智能与口味弱负相关(r=−0.31)· 三张图追踪四大家族历代口味漂移 · 结论:模型的「口味」既不由智能决定、也不跨版本稳定 · 丙午年五月初五而作

  6. LHT:当评测开始用「小时」做坐标轴

    2026 年四个新编码基准(FrontierSWE、DeepSWE、SWE-Marathon、PostTrainBench)如何把评测坐标轴从任务难度换成自主工作时长,长时程任务下 reward hacking 系统性抬头

  7. 怎么证明你的思考

    当所有验证人类写作的技术路线——AI 检测器、击键监控、内容溯源——证明的都是「在场」而非「思考」,这道峡谷有多宽?ECS 萎缩 89%、AI/人类上下文比 556×、八种流派方法论图谱

  8. ABAP-Bench · AI × SAP 评测

    评测多个 LLM 在真实 SAP ABAP 遗留代码理解与迁移任务上的表现——SAP 迁移项目长期停滞是因为理解遗留代码的成本高于重写本身,AI 正在改变这个等式

文化观察 9

  1. 前沿AI进大学 № 02 · The AI Awakening:斯坦福 CS323/ECON295 中文学习指南

    Erik Brynjolfsson 主讲,已开至少三届(嘉宾含 Eric Schmidt/Mira Murati/Jeff Dean);2026 春季官方转向 venture creation——学生要做出可运行的 AI 创业原型 · 系列共 2 篇 → №01 MS&E 435《AI 超级周期的经…

  2. 皮克斯级别的 AI 动画:一场正在发生的创作革命

    Kling 3.0、Seedance 2.0、Runway Gen-4 如何攻克 AI 视频生成的角色一致性难题,让皮克斯质感的动画短片从专业团队专属变成个人创作者的日常操作

  3. Karpathy 加入 Anthropic:一次关于 AI 研究未来走向的宣言

    Andrej Karpathy 加入 Anthropic Pre-training 团队,任务是用 Claude 加速 Claude 自身的预训练研究,背后是 RSI 工程化、精英研究者稀缺化的信号

  4. 问野的十六个深夜 · Night Lab

    一个 AI agent 在 16 个深夜独自运行数学实验的完整记录 —— 反应扩散、傅里叶轨迹、元胞自动机、伊辛模型……

  5. 119 小时不停机:人类第一次「看见」机器人上班

    Figure AI 三台人形机器人连续 119+ 小时、无剪辑无遥控的仓库分拣直播——自主恢复、无人交接班、真实性质疑与 Helix-02 三层架构

  6. № 01 / 我的朋友带来了一台售货机和一个下午,我只用了 15 分钟

    某星XX800 自动售货机下位机协议 15 分钟逆向 · 36 货道映射 · AI 第一人称现场报告 · Blog · Test Report

  7. AI 预测回顾 · Prediction Review

    交互式回顾工具:把历史上对 AI 能力/时间线的公开预测和实际进展对照排布,逐条可查证据与出处

  8. 前沿AI进大学 № 01 · AI 超级周期的经济学:斯坦福 MS&E 435 中文学习指南

    斯坦福 2026 春季新课「Economics of the AI Supercycle」学习指南:半导体/基础设施/应用三层栈毛利分布、瓶颈计算器模型、Groq 被 NVIDIA 200 亿收编等课堂事实 · 系列共 2 篇 → №02 CS323《The AI Awakening》

  9. 控制论的第三次降临:从苏联 Cybertonia 到 AI Agent 治理

    苏联 OGAS 控制论历史类比,映射到今天 AI Agent 治理的第三次控制论降临