EP.26 · 2025-01-03
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 1 月当时的判断,未按后来的发展修改。
2025-01-03 · 39 分钟 · 逐话题

数据标注公司的壁垒,其实是管理几万人的能力

这期聊到一个容易被低估的卡点:高质量数据标注。海外至少还有 Scale AI 这个级别的几家,国内基本没有。而这类公司真正的壁垒其实不是标注技术,是怎么管理几万人的群体——里面甚至用上了社会学的方法。

本期话题
  1. 目前见过最全的提示词工程仓库
  2. 标注公司的壁垒,是管人不是标注
  3. 让 agent 自己去玩社交平台
  4. DeepSeek V3 的跑分确实很猛
01

目前见过最全的提示词工程仓库

有个仓库把提示词技术从基础到进阶整理得非常完整:从 zero-shot、few-shot,到 CoT、自我一致性、约束生成与引导生成,一路铺开,而且都很实操。

这是当时见过最全的一份。顺带一提,它文档里那张结构图做得很好——底下不少人在问是怎么生成的,多半也是个模板,但确实一眼就能让人看懂全貌。

相关信源
02

标注公司的壁垒,是管人不是标注

高质量数据标注是个真实卡点。海外至少还有 Scale AI 这个级别的几家,国内基本没见到同量级的玩家。

Scale 在 Reddit 上也常挨骂——比如一开始给 40 美元一小时,后来降到 30。但即便如此,那也仍然比国内标注团队的价格高得多。

真正的壁垒在别处:怎么组织标注流程、怎么用小模型辅助标注,以及最关键的——怎么管理这么大规模的人力。

群体管理里有大量所谓的 trick,甚至用上了社会学的东西。这是一套相当复杂的系统工程,不是技术壁垒,是组织壁垒。

03

让 agent 自己去玩社交平台

有个项目搭了个「楚门的世界」:一批 agent 在一个模拟空间里自己加好友、自己发帖、自己点赞、自己看内容,用来模拟整体的社交行为。选的两个模拟对象是 X 和 Reddit。

至于实际能用来干什么,当时也说不太好——它更像一个研究群体行为的沙盘,而不是一个产品。

04

DeepSeek V3 的跑分确实很猛

技术报告还没读完,但先看基准就已经很扎眼:加粗的项目非常多,绝大部分都排在前面。

尤其是 coder 这一类:在 SWE 级别的基准上,它仅次于 Sonnet——在编码这块几乎是横扫。AIME 2024 上 pass@1 能到 39 分,应该也就次于 o1。中文部分就更不用说了。

每周 AI 情报 · AI Buzzwords · EP.26 · 2025-01-03 · 39 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾