这期聊到一个容易被低估的卡点:高质量数据标注。海外至少还有 Scale AI 这个级别的几家,国内基本没有。而这类公司真正的壁垒其实不是标注技术,是怎么管理几万人的群体——里面甚至用上了社会学的方法。
有个仓库把提示词技术从基础到进阶整理得非常完整:从 zero-shot、few-shot,到 CoT、自我一致性、约束生成与引导生成,一路铺开,而且都很实操。
这是当时见过最全的一份。顺带一提,它文档里那张结构图做得很好——底下不少人在问是怎么生成的,多半也是个模板,但确实一眼就能让人看懂全貌。
高质量数据标注是个真实卡点。海外至少还有 Scale AI 这个级别的几家,国内基本没见到同量级的玩家。
Scale 在 Reddit 上也常挨骂——比如一开始给 40 美元一小时,后来降到 30。但即便如此,那也仍然比国内标注团队的价格高得多。
真正的壁垒在别处:怎么组织标注流程、怎么用小模型辅助标注,以及最关键的——怎么管理这么大规模的人力。
群体管理里有大量所谓的 trick,甚至用上了社会学的东西。这是一套相当复杂的系统工程,不是技术壁垒,是组织壁垒。
有个项目搭了个「楚门的世界」:一批 agent 在一个模拟空间里自己加好友、自己发帖、自己点赞、自己看内容,用来模拟整体的社交行为。选的两个模拟对象是 X 和 Reddit。
至于实际能用来干什么,当时也说不太好——它更像一个研究群体行为的沙盘,而不是一个产品。
技术报告还没读完,但先看基准就已经很扎眼:加粗的项目非常多,绝大部分都排在前面。
尤其是 coder 这一类:在 SWE 级别的基准上,它仅次于 Sonnet——在编码这块几乎是横扫。AIME 2024 上 pass@1 能到 39 分,应该也就次于 o1。中文部分就更不用说了。