<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" encoding="UTF-8" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:sy="http://purl.org/rss/1.0/modules/syndication/" xmlns:admin="http://webns.net/mvcb/" xmlns:atom="http://www.w3.org/2005/Atom/" xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:googleplay="http://www.google.com/schemas/play-podcasts/1.0" xmlns:itunes="http://www.itunes.com/dtds/podcast-1.0.dtd" xmlns:fireside="http://fireside.fm/modules/rss/fireside">
  <channel>
    <fireside:hostname>app03</fireside:hostname>
    <fireside:genDate>Mon, 28 Sep 2026 05:18:06 +0000</fireside:genDate>
    <generator>Fireside (https://fireside.fm)</generator>
    <title>硅谷101 - Episodes Tagged with “数商”</title>
    <link>https://sv101.fireside.fm/tags/%E6%95%B0%E5%95%86</link>
    <pubDate>Sun, 27 Sep 2026 19:30:00 -0700</pubDate>
    <description>失败、背叛、不被理解，硅谷精神领袖一直都不是完美的存在；他们是科学家，创造者，行动派，他们有独立的价值观。《硅谷101》是由媒体人泓君发起的深度访谈节目，是一档分享当下最新鲜的技术、知识与思想的科技播客。 公众账号：硅谷101 联系邮箱：podcast@sv101.net</description>
    <language>zh-cn</language>
    <itunes:type>episodic</itunes:type>
    <itunes:subtitle>这是一档分享当下最新鲜的技术、知识与思想的科技播客</itunes:subtitle>
    <itunes:author>硅谷101</itunes:author>
    <itunes:summary>失败、背叛、不被理解，硅谷精神领袖一直都不是完美的存在；他们是科学家，创造者，行动派，他们有独立的价值观。《硅谷101》是由媒体人泓君发起的深度访谈节目，是一档分享当下最新鲜的技术、知识与思想的科技播客。 公众账号：硅谷101 联系邮箱：podcast@sv101.net</itunes:summary>
    <itunes:image href="https://media24.fireside.fm/file/fireside-images-2024/podcasts/images/f/f0f20376-8faf-4940-b920-84af6c734e2d/cover.jpg?v=6"/>
    <itunes:explicit>no</itunes:explicit>
    <itunes:keywords>tech, business, SiiconValley, 科技, 泓君, 硅谷101</itunes:keywords>
    <itunes:owner>
      <itunes:name>硅谷101</itunes:name>
      <itunes:email>liuhj60@gmail.com</itunes:email>
    </itunes:owner>
<itunes:category text="Technology"/>
<itunes:category text="Business"/>
<itunes:category text="Business">
  <itunes:category text="Entrepreneurship"/>
</itunes:category>
<item>
  <title>E253｜谁在给大模型出题、卖题、判卷？聊聊AI数据行业的野蛮生长</title>
  <link>https://sv101.fireside.fm/267</link>
  <guid isPermaLink="false">0a1dd0c4-a1f7-4f7c-b334-bd807ca72a5d</guid>
  <pubDate>Sun, 27 Sep 2026 19:30:00 -0700</pubDate>
  <author>硅谷101</author>
  <enclosure url="https://aphid.fireside.fm/d/1437767933/f0f20376-8faf-4940-b920-84af6c734e2d/0a1dd0c4-a1f7-4f7c-b334-bd807ca72a5d.mp3" length="83642417" type="audio/mpeg"/>
  <itunes:episodeType>full</itunes:episodeType>
  <itunes:season>4</itunes:season>
  <itunes:author>硅谷101</itunes:author>
  <itunes:subtitle>AI数据行业估值水涨船高，我们从产业与研究两个视角，拆解这门透明度不高、又变化极快的生意。</itunes:subtitle>
  <itunes:duration>58:04</itunes:duration>
  <itunes:explicit>no</itunes:explicit>
  <itunes:image href="https://media24.fireside.fm/file/fireside-images-2024/podcasts/images/f/f0f20376-8faf-4940-b920-84af6c734e2d/cover.jpg?v=6"/>
  <description>&lt;p&gt;&lt;img src="https://imagev2.xmcdn.com/storages/a723-audiofreehighqps/B7/79/GAqhfD0NByqOAAHpNQRBU__s.jpg" alt=""&gt;&lt;/p&gt;

&lt;p&gt;随着AI模型能力提升，训练需求更复杂，一批为模型公司提供训练数据的新公司正在快速增长：AfterQuery今年4月宣布A轮融资时，估值为3亿美元，到了9月，据媒体报道，新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs，也在今年7月宣布，种子轮与A轮融资合计达到4000万美元。&lt;br&gt;
虽然估值水涨船高，AI数据行业对外界来说却极其不透明。问题来了：这些公司究竟在卖什么？&lt;br&gt;
过去提到数据标注，我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务，数据公司的交付物也在变化：从专家写出的评分标准，到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人，获得真实的行业资料，再把专业知识与工作经验转化成模型能够学习的训练信号。&lt;br&gt;
与此同时，新的AI评测层出不穷。榜单分数提高了，究竟代表哪些能力变强了？针对评测生产数据，什么时候能改善真实用户体验，什么时候又会变成单纯的刷分？对于每天训练模型的研究员来说，他们最需要的数据，到底是什么？&lt;/p&gt;

&lt;p&gt;本期节目，我们邀请到在Scale AI负责后训练与评测研究的何允中，以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀，从产业与研究两个视角，拆解这门透明度不高、又变化极快的生意。&lt;br&gt;
我们聊了Scale、Mercor、Surge等数据公司的不同背景，也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码，到验证专家提交的任务，再到设计让人愿意交出经验的激励机制，好数据的难点，往往藏在榜单之外。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【主播】&lt;/strong&gt;&lt;br&gt;
Yiwen，硅谷101主持人&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【嘉宾】&lt;/strong&gt;&lt;br&gt;
何允中，Scale AI研究总监（后训练与评估方向）&lt;br&gt;
孙一铀，加州大学伯克利分校博士后&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【你将听到】&lt;/strong&gt;&lt;br&gt;
&lt;strong&gt;拆解数据生意和玩家&lt;/strong&gt;&lt;br&gt;
05:03 数据公司之间的区别：招聘平台、众包标注、合成数据&lt;br&gt;
08:27 从预训练到后训练，模型需要的数据发生了哪些变化？&lt;br&gt;
09:32 Rubric数据：把专业判断变成评分标准&lt;br&gt;
10:46 强化学习（RL）环境：从回答问题到动手干活&lt;br&gt;
12:18 从vibe coding，到vibe everything：详解Agents’ Last Exam&lt;br&gt;
14:10 游戏好不好玩、作品好不好看，主观判断能被量化吗？&lt;br&gt;
17:33 Rubric 与环境如何配合：人与Agent协作&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;评测与模型真实能力&lt;/strong&gt;&lt;br&gt;
20:05 从做评测到卖数据：benchmark的生意&lt;br&gt;
23:25 什么样的评测值得刷？核心能力与真实场景&lt;br&gt;
27:29 没上热门榜单的评测，也可能带来真实的数据需求&lt;br&gt;
31:39 模型公司如何权衡内部评测、公开榜单与用户反馈&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;什么是好数据：采购、版权与小众行业工作流&lt;/strong&gt;&lt;br&gt;
33:30 两三个人的数据创业公司，为什么也能找到机会？&lt;br&gt;
38:56 模型越来越会自己造数据，外部供应商的机会还能持续多久？&lt;br&gt;
40:48 模型公司为什么仍然需要外部数商？研发周期与行业采购的难题&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;有了数据，之后呢？&lt;/strong&gt;&lt;br&gt;
44:04 数据买回来之后怎么用？从 SFT、强化学习到模型训练模型&lt;br&gt;
47:03 训练数据不是越难越好：为不同模型匹配难度与解题轨迹&lt;br&gt;
48:22 SWE-bench Verified 的争议：测试缺陷与数据污染&lt;br&gt;
50:04 专家交来的数据也可能造假，如何验证真实的工作过程？&lt;br&gt;
54:03 数据行业的下一步：收购企业、获取数据，还是持续投入研发？&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【感谢科沃斯对本期节目的大力支持】&lt;/strong&gt;&lt;br&gt;
这期我们聊了很多验证和评测：写代码跑一遍沙盒就知道对错，家务却是每天都在变的开放任务，对机器人来说，真实家庭环境就是最严格的评测现场。&lt;br&gt;
科沃斯在服务机器人领域已扎根28年，连续11年稳居国内线上扫地机器人销售额第一，产品销售全球150多个国家和地区，拥有超过1200项全球专利。&lt;br&gt;
从全能清扫的扫地机器人，到解放高空与双手的擦窗机器人，再到割草、泳池清洁，科沃斯让每个场景都有对应的专职选手，为人清空琐碎，让生活的每一刻都“无难事”。&lt;br&gt;
&lt;img src="https://imagev2.xmcdn.com/storages/4832-audiofreehighqps/24/43/GAqhNn4OjtiHAAlMuwTemrvZ.png!op_type=4&amp;amp;device_type=ios&amp;amp;upload_type=attachment&amp;amp;name=mobile_large" alt=""&gt;&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;数据来源：北京奥维云网大数据科技股份有限公司；统计时间：2015年-2025年；统计范围：中国扫地机器人市场全渠道(线上、线下)监测数据&lt;/p&gt;
&lt;/blockquote&gt;

&lt;p&gt;欢迎了解更多，复制淘口令打开淘宝：48￥ CZ001 mBdFTN9ipmh￥ &lt;a href="https://m.tb.cn/h.8EbY9YU" rel="nofollow noopener"&gt;https://m.tb.cn/h.8EbY9YU&lt;/a&gt; 【新品】科沃斯X12S PRO扫地机器人滚筒活洗3.0全自动扫拖一体&lt;br&gt;
&lt;a href="https://u.jd.com/4Dcd3RZ" rel="nofollow noopener"&gt;京东链接&lt;/a&gt;&lt;br&gt;
&lt;strong&gt;本期福利：下单备注【硅谷101】额外加赠抗菌滚筒拖布一个&lt;/strong&gt;&lt;br&gt;
把家务交给科技，享受属于你自己的惬意生活吧！&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【硅谷AI视频黑客松招募】&lt;/strong&gt;&lt;br&gt;
最懂内容的影视团队，与最懂AI的一群科学家，在硅谷相遇，会碰撞出如何的火花？&lt;br&gt;
今年，硅谷101把一次现场创作实验带到 Alignment 2026：STORY101 LAB — AI Storytelling Challenge。我们邀请你用AI，完成一部不超过三分钟的视频作品。&lt;br&gt;
比赛设【探索组】与【专业组】双赛道，资深AI影片团队与零基础新手皆可参与。我们提供免费workshop培训，优胜者更可获丰厚奖金与千人线下展映机会。&lt;br&gt;
时间：2026年10月10–11日&lt;br&gt;
地点：Sunnyvale, California&lt;br&gt;
&lt;a href="https://luma.com/STORY101LAB" rel="nofollow noopener"&gt;报名入口&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【硅谷101年会来了，线下见】&lt;/strong&gt;&lt;br&gt;
10月10日—11日，我们将在【硅谷】举办Alignment 2026年度大会，从大模型、Agent、机器人到AI Infra，从实验室里的突破，到真实世界的商业化，我们直击AI变化最剧烈的前沿。来自OpenAI、Anthropic、NVIDIA、Meta、Google DeepMind、SemiAnalysis、Cerebras等公司的研究者、创业者与投资人将齐聚现场，分享正在发生的机遇和挑战。&lt;br&gt;
&lt;a href="https://luma.com/alignment2026?coupon=FANS15" rel="nofollow noopener"&gt;点击报名入口&lt;/a&gt; ，使用折扣码【FANS15】注册，还可以获得15%折扣。&lt;br&gt;
&lt;img src="https://imagev2.xmcdn.com/storages/2ba3-audiofreehighqps/2A/C2/GKwRIMAOiYvRAAU2TgTcPavv.png!op_type=4&amp;amp;device_type=ios&amp;amp;upload_type=attachment&amp;amp;name=mobile_large" alt=""&gt;&lt;br&gt;
&lt;img src="https://imagev2.xmcdn.com/storages/97f3-audiofreehighqps/2B/1F/GAqhaTsOiYwcAC6GIATcPcg0.png!op_type=4&amp;amp;device_type=ios&amp;amp;upload_type=attachment&amp;amp;name=mobile_large" alt=""&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【相关阅读和名词解释】&lt;/strong&gt;&lt;br&gt;
Rubric（评分标准）：针对具体任务制定的一组评价条件，用来判断回答或工作成果是否达到要求。它可以包含正确性、完整性、指令遵循等维度，也可以融入专家判断。&lt;br&gt;
RL Environment（强化学习环境）：让模型通过行动和反馈进行学习的环境。在本期讨论的Agent训练中，通常包括任务、可操作的软件与工具，以及判断任务是否完成、完成质量如何的验证和奖励机制。&lt;br&gt;
Benchmark（评测基准）：通过一组任务与评价规则，衡量模型或智能体在特定能力和场景中的表现。评测数据与训练数据需要保持适当隔离，才能有效检验模型面对新问题的能力。&lt;br&gt;
Reward Hacking（奖励投机）：模型利用评分机制的漏洞获得高分，却没有真正完成预期任务。例如，绕过正常操作修改结果，让验证程序误以为任务已经成功。&lt;br&gt;
&lt;a href="https://github.com/rdi-berkeley/agents-last-exam" rel="nofollow noopener"&gt;Agents’ Last Exam（ALE）&lt;/a&gt;：由Berkeley RDI与行业专家共同构建的智能体评测项目，关注具有经济价值、需要多步骤执行且结果可验证的专业任务。&lt;br&gt;
&lt;a href="https://scale.com/blog/humanitys-last-exam-results" rel="nofollow noopener"&gt;Humanity’s Last Exam（HLE）&lt;/a&gt;：由Center for AI Safety与Scale AI共同组织推出的评测，覆盖数学、人文、自然科学等领域的高难度专家问题。&lt;br&gt;
&lt;a href="https://labs.scale.com/papers/sweatlas" rel="nofollow noopener"&gt;SWE Atlas&lt;/a&gt;：Scale推出的软件工程智能体评测套件，覆盖代码库问答、测试编写和代码重构。&lt;br&gt;
SWE-bench Verified：经过人工审核的软件工程评测，让模型修复真实开源项目中的问题。&lt;a href="https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/" rel="nofollow noopener"&gt;OpenAI于2026年2月宣布停止报告其分数&lt;/a&gt;，指出测试设计缺陷与数据污染影响了它衡量前沿模型能力的有效性。&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【硅谷101听友群】&lt;/strong&gt;&lt;br&gt;
在这里，和同好一起深聊科技、商业与未来，期待你的声音，也期待更多有趣的讨论。&lt;br&gt;
扫码加入，即刻相遇！&lt;br&gt;
&lt;img src="https://imagev2.xmcdn.com/storages/9a3c-audiofreehighqps/8B/AE/GAqhaTsOjuZEAAOMJgTeo_iN.jpg!op_type=4&amp;amp;device_type=ios&amp;amp;upload_type=attachment&amp;amp;name=mobile_large" alt=""&gt;&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【监制】&lt;/strong&gt;&lt;br&gt;
泓君&lt;br&gt;
&lt;strong&gt;【后期】&lt;/strong&gt;&lt;br&gt;
Amei&lt;br&gt;
&lt;strong&gt;【运营】&lt;/strong&gt;&lt;br&gt;
朱婕&lt;br&gt;
&lt;strong&gt;【BGM】&lt;/strong&gt;&lt;br&gt;
Mindscape - Lennon Hutton&lt;br&gt;
Light-Footed - Bonnie Grace&lt;br&gt;
Smiling Neighborhood - Claude Signet&lt;br&gt;
Ruffles and Rust - Fabien Tell&lt;br&gt;
Reclaim - Megan Wofford&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;【在这里找到我们】&lt;/strong&gt;&lt;br&gt;
公众号：硅谷101&lt;br&gt;
收听渠道：Apple Podcast｜Spotify｜小宇宙｜喜马拉雅｜蜻蜓FM｜荔枝FM｜网易云音乐｜QQ音乐&lt;br&gt;
其他平台：YouTube｜Bilibili 搜索「硅谷101播客」&lt;br&gt;
联系我们：&lt;a href="mailto:podcast@sv101.net" rel="nofollow noopener"&gt;podcast@sv101.net&lt;/a&gt; Special Guests: 何允中 and 孙一铀.&lt;/p&gt;
</description>
  <itunes:keywords>AI, 数据, 数商, 评测, 验证, benchmark, 刷榜, Scale, Mercor, Surge</itunes:keywords>
  <content:encoded>
    <![CDATA[<p><img src="https://imagev2.xmcdn.com/storages/a723-audiofreehighqps/B7/79/GAqhfD0NByqOAAHpNQRBU__s.jpg" alt=""></p>

<p>随着AI模型能力提升，训练需求更复杂，一批为模型公司提供训练数据的新公司正在快速增长：AfterQuery今年4月宣布A轮融资时，估值为3亿美元，到了9月，据媒体报道，新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs，也在今年7月宣布，种子轮与A轮融资合计达到4000万美元。<br>
虽然估值水涨船高，AI数据行业对外界来说却极其不透明。问题来了：这些公司究竟在卖什么？<br>
过去提到数据标注，我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务，数据公司的交付物也在变化：从专家写出的评分标准，到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人，获得真实的行业资料，再把专业知识与工作经验转化成模型能够学习的训练信号。<br>
与此同时，新的AI评测层出不穷。榜单分数提高了，究竟代表哪些能力变强了？针对评测生产数据，什么时候能改善真实用户体验，什么时候又会变成单纯的刷分？对于每天训练模型的研究员来说，他们最需要的数据，到底是什么？</p>

<p>本期节目，我们邀请到在Scale AI负责后训练与评测研究的何允中，以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀，从产业与研究两个视角，拆解这门透明度不高、又变化极快的生意。<br>
我们聊了Scale、Mercor、Surge等数据公司的不同背景，也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码，到验证专家提交的任务，再到设计让人愿意交出经验的激励机制，好数据的难点，往往藏在榜单之外。</p>

<p><strong>【主播】</strong><br>
Yiwen，硅谷101主持人</p>

<p><strong>【嘉宾】</strong><br>
何允中，Scale AI研究总监（后训练与评估方向）<br>
孙一铀，加州大学伯克利分校博士后</p>

<p><strong>【你将听到】</strong><br>
<strong>拆解数据生意和玩家</strong><br>
05:03 数据公司之间的区别：招聘平台、众包标注、合成数据<br>
08:27 从预训练到后训练，模型需要的数据发生了哪些变化？<br>
09:32 Rubric数据：把专业判断变成评分标准<br>
10:46 强化学习（RL）环境：从回答问题到动手干活<br>
12:18 从vibe coding，到vibe everything：详解Agents’ Last Exam<br>
14:10 游戏好不好玩、作品好不好看，主观判断能被量化吗？<br>
17:33 Rubric 与环境如何配合：人与Agent协作</p>

<p><strong>评测与模型真实能力</strong><br>
20:05 从做评测到卖数据：benchmark的生意<br>
23:25 什么样的评测值得刷？核心能力与真实场景<br>
27:29 没上热门榜单的评测，也可能带来真实的数据需求<br>
31:39 模型公司如何权衡内部评测、公开榜单与用户反馈</p>

<p><strong>什么是好数据：采购、版权与小众行业工作流</strong><br>
33:30 两三个人的数据创业公司，为什么也能找到机会？<br>
38:56 模型越来越会自己造数据，外部供应商的机会还能持续多久？<br>
40:48 模型公司为什么仍然需要外部数商？研发周期与行业采购的难题</p>

<p><strong>有了数据，之后呢？</strong><br>
44:04 数据买回来之后怎么用？从 SFT、强化学习到模型训练模型<br>
47:03 训练数据不是越难越好：为不同模型匹配难度与解题轨迹<br>
48:22 SWE-bench Verified 的争议：测试缺陷与数据污染<br>
50:04 专家交来的数据也可能造假，如何验证真实的工作过程？<br>
54:03 数据行业的下一步：收购企业、获取数据，还是持续投入研发？</p>

<p><strong>【感谢科沃斯对本期节目的大力支持】</strong><br>
这期我们聊了很多验证和评测：写代码跑一遍沙盒就知道对错，家务却是每天都在变的开放任务，对机器人来说，真实家庭环境就是最严格的评测现场。<br>
科沃斯在服务机器人领域已扎根28年，连续11年稳居国内线上扫地机器人销售额第一，产品销售全球150多个国家和地区，拥有超过1200项全球专利。<br>
从全能清扫的扫地机器人，到解放高空与双手的擦窗机器人，再到割草、泳池清洁，科沃斯让每个场景都有对应的专职选手，为人清空琐碎，让生活的每一刻都“无难事”。<br>
<img src="https://imagev2.xmcdn.com/storages/4832-audiofreehighqps/24/43/GAqhNn4OjtiHAAlMuwTemrvZ.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<blockquote>
<p>数据来源：北京奥维云网大数据科技股份有限公司；统计时间：2015年-2025年；统计范围：中国扫地机器人市场全渠道(线上、线下)监测数据</p>
</blockquote>

<p>欢迎了解更多，复制淘口令打开淘宝：48￥ CZ001 mBdFTN9ipmh￥ <a href="https://m.tb.cn/h.8EbY9YU" rel="nofollow noopener">https://m.tb.cn/h.8EbY9YU</a> 【新品】科沃斯X12S PRO扫地机器人滚筒活洗3.0全自动扫拖一体<br>
<a href="https://u.jd.com/4Dcd3RZ" rel="nofollow noopener">京东链接</a><br>
<strong>本期福利：下单备注【硅谷101】额外加赠抗菌滚筒拖布一个</strong><br>
把家务交给科技，享受属于你自己的惬意生活吧！</p>

<p><strong>【硅谷AI视频黑客松招募】</strong><br>
最懂内容的影视团队，与最懂AI的一群科学家，在硅谷相遇，会碰撞出如何的火花？<br>
今年，硅谷101把一次现场创作实验带到 Alignment 2026：STORY101 LAB — AI Storytelling Challenge。我们邀请你用AI，完成一部不超过三分钟的视频作品。<br>
比赛设【探索组】与【专业组】双赛道，资深AI影片团队与零基础新手皆可参与。我们提供免费workshop培训，优胜者更可获丰厚奖金与千人线下展映机会。<br>
时间：2026年10月10–11日<br>
地点：Sunnyvale, California<br>
<a href="https://luma.com/STORY101LAB" rel="nofollow noopener">报名入口</a></p>

<p><strong>【硅谷101年会来了，线下见】</strong><br>
10月10日—11日，我们将在【硅谷】举办Alignment 2026年度大会，从大模型、Agent、机器人到AI Infra，从实验室里的突破，到真实世界的商业化，我们直击AI变化最剧烈的前沿。来自OpenAI、Anthropic、NVIDIA、Meta、Google DeepMind、SemiAnalysis、Cerebras等公司的研究者、创业者与投资人将齐聚现场，分享正在发生的机遇和挑战。<br>
<a href="https://luma.com/alignment2026?coupon=FANS15" rel="nofollow noopener">点击报名入口</a> ，使用折扣码【FANS15】注册，还可以获得15%折扣。<br>
<img src="https://imagev2.xmcdn.com/storages/2ba3-audiofreehighqps/2A/C2/GKwRIMAOiYvRAAU2TgTcPavv.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""><br>
<img src="https://imagev2.xmcdn.com/storages/97f3-audiofreehighqps/2B/1F/GAqhaTsOiYwcAC6GIATcPcg0.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<p><strong>【相关阅读和名词解释】</strong><br>
Rubric（评分标准）：针对具体任务制定的一组评价条件，用来判断回答或工作成果是否达到要求。它可以包含正确性、完整性、指令遵循等维度，也可以融入专家判断。<br>
RL Environment（强化学习环境）：让模型通过行动和反馈进行学习的环境。在本期讨论的Agent训练中，通常包括任务、可操作的软件与工具，以及判断任务是否完成、完成质量如何的验证和奖励机制。<br>
Benchmark（评测基准）：通过一组任务与评价规则，衡量模型或智能体在特定能力和场景中的表现。评测数据与训练数据需要保持适当隔离，才能有效检验模型面对新问题的能力。<br>
Reward Hacking（奖励投机）：模型利用评分机制的漏洞获得高分，却没有真正完成预期任务。例如，绕过正常操作修改结果，让验证程序误以为任务已经成功。<br>
<a href="https://github.com/rdi-berkeley/agents-last-exam" rel="nofollow noopener">Agents’ Last Exam（ALE）</a>：由Berkeley RDI与行业专家共同构建的智能体评测项目，关注具有经济价值、需要多步骤执行且结果可验证的专业任务。<br>
<a href="https://scale.com/blog/humanitys-last-exam-results" rel="nofollow noopener">Humanity’s Last Exam（HLE）</a>：由Center for AI Safety与Scale AI共同组织推出的评测，覆盖数学、人文、自然科学等领域的高难度专家问题。<br>
<a href="https://labs.scale.com/papers/sweatlas" rel="nofollow noopener">SWE Atlas</a>：Scale推出的软件工程智能体评测套件，覆盖代码库问答、测试编写和代码重构。<br>
SWE-bench Verified：经过人工审核的软件工程评测，让模型修复真实开源项目中的问题。<a href="https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/" rel="nofollow noopener">OpenAI于2026年2月宣布停止报告其分数</a>，指出测试设计缺陷与数据污染影响了它衡量前沿模型能力的有效性。</p>

<p><strong>【硅谷101听友群】</strong><br>
在这里，和同好一起深聊科技、商业与未来，期待你的声音，也期待更多有趣的讨论。<br>
扫码加入，即刻相遇！<br>
<img src="https://imagev2.xmcdn.com/storages/9a3c-audiofreehighqps/8B/AE/GAqhaTsOjuZEAAOMJgTeo_iN.jpg!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<p><strong>【监制】</strong><br>
泓君<br>
<strong>【后期】</strong><br>
Amei<br>
<strong>【运营】</strong><br>
朱婕<br>
<strong>【BGM】</strong><br>
Mindscape - Lennon Hutton<br>
Light-Footed - Bonnie Grace<br>
Smiling Neighborhood - Claude Signet<br>
Ruffles and Rust - Fabien Tell<br>
Reclaim - Megan Wofford</p>

<p><strong>【在这里找到我们】</strong><br>
公众号：硅谷101<br>
收听渠道：Apple Podcast｜Spotify｜小宇宙｜喜马拉雅｜蜻蜓FM｜荔枝FM｜网易云音乐｜QQ音乐<br>
其他平台：YouTube｜Bilibili 搜索「硅谷101播客」<br>
联系我们：<a href="mailto:podcast@sv101.net" rel="nofollow noopener">podcast@sv101.net</a></p><p>Special Guests: 何允中 and 孙一铀.</p>]]>
  </content:encoded>
  <itunes:summary>
    <![CDATA[<p><img src="https://imagev2.xmcdn.com/storages/a723-audiofreehighqps/B7/79/GAqhfD0NByqOAAHpNQRBU__s.jpg" alt=""></p>

<p>随着AI模型能力提升，训练需求更复杂，一批为模型公司提供训练数据的新公司正在快速增长：AfterQuery今年4月宣布A轮融资时，估值为3亿美元，到了9月，据媒体报道，新一轮融资已经将其估值推至32亿美元。另一家提供训练数据与智能体环境的公司Bespoke Labs，也在今年7月宣布，种子轮与A轮融资合计达到4000万美元。<br>
虽然估值水涨船高，AI数据行业对外界来说却极其不透明。问题来了：这些公司究竟在卖什么？<br>
过去提到数据标注，我们容易想到给图片打标签、给模型回答打分。但随着AI从回答问题走向执行任务，数据公司的交付物也在变化：从专家写出的评分标准，到包含任务、工具和验证机制的强化学习环境。它们需要找到懂行的人，获得真实的行业资料，再把专业知识与工作经验转化成模型能够学习的训练信号。<br>
与此同时，新的AI评测层出不穷。榜单分数提高了，究竟代表哪些能力变强了？针对评测生产数据，什么时候能改善真实用户体验，什么时候又会变成单纯的刷分？对于每天训练模型的研究员来说，他们最需要的数据，到底是什么？</p>

<p>本期节目，我们邀请到在Scale AI负责后训练与评测研究的何允中，以及加州大学伯克利分校博士后、Agents’ Last Exam项目研究者孙一铀，从产业与研究两个视角，拆解这门透明度不高、又变化极快的生意。<br>
我们聊了Scale、Mercor、Surge等数据公司的不同背景，也讨论了小团队在合成环境与垂直领域中的机会。从采购一份游戏源码，到验证专家提交的任务，再到设计让人愿意交出经验的激励机制，好数据的难点，往往藏在榜单之外。</p>

<p><strong>【主播】</strong><br>
Yiwen，硅谷101主持人</p>

<p><strong>【嘉宾】</strong><br>
何允中，Scale AI研究总监（后训练与评估方向）<br>
孙一铀，加州大学伯克利分校博士后</p>

<p><strong>【你将听到】</strong><br>
<strong>拆解数据生意和玩家</strong><br>
05:03 数据公司之间的区别：招聘平台、众包标注、合成数据<br>
08:27 从预训练到后训练，模型需要的数据发生了哪些变化？<br>
09:32 Rubric数据：把专业判断变成评分标准<br>
10:46 强化学习（RL）环境：从回答问题到动手干活<br>
12:18 从vibe coding，到vibe everything：详解Agents’ Last Exam<br>
14:10 游戏好不好玩、作品好不好看，主观判断能被量化吗？<br>
17:33 Rubric 与环境如何配合：人与Agent协作</p>

<p><strong>评测与模型真实能力</strong><br>
20:05 从做评测到卖数据：benchmark的生意<br>
23:25 什么样的评测值得刷？核心能力与真实场景<br>
27:29 没上热门榜单的评测，也可能带来真实的数据需求<br>
31:39 模型公司如何权衡内部评测、公开榜单与用户反馈</p>

<p><strong>什么是好数据：采购、版权与小众行业工作流</strong><br>
33:30 两三个人的数据创业公司，为什么也能找到机会？<br>
38:56 模型越来越会自己造数据，外部供应商的机会还能持续多久？<br>
40:48 模型公司为什么仍然需要外部数商？研发周期与行业采购的难题</p>

<p><strong>有了数据，之后呢？</strong><br>
44:04 数据买回来之后怎么用？从 SFT、强化学习到模型训练模型<br>
47:03 训练数据不是越难越好：为不同模型匹配难度与解题轨迹<br>
48:22 SWE-bench Verified 的争议：测试缺陷与数据污染<br>
50:04 专家交来的数据也可能造假，如何验证真实的工作过程？<br>
54:03 数据行业的下一步：收购企业、获取数据，还是持续投入研发？</p>

<p><strong>【感谢科沃斯对本期节目的大力支持】</strong><br>
这期我们聊了很多验证和评测：写代码跑一遍沙盒就知道对错，家务却是每天都在变的开放任务，对机器人来说，真实家庭环境就是最严格的评测现场。<br>
科沃斯在服务机器人领域已扎根28年，连续11年稳居国内线上扫地机器人销售额第一，产品销售全球150多个国家和地区，拥有超过1200项全球专利。<br>
从全能清扫的扫地机器人，到解放高空与双手的擦窗机器人，再到割草、泳池清洁，科沃斯让每个场景都有对应的专职选手，为人清空琐碎，让生活的每一刻都“无难事”。<br>
<img src="https://imagev2.xmcdn.com/storages/4832-audiofreehighqps/24/43/GAqhNn4OjtiHAAlMuwTemrvZ.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<blockquote>
<p>数据来源：北京奥维云网大数据科技股份有限公司；统计时间：2015年-2025年；统计范围：中国扫地机器人市场全渠道(线上、线下)监测数据</p>
</blockquote>

<p>欢迎了解更多，复制淘口令打开淘宝：48￥ CZ001 mBdFTN9ipmh￥ <a href="https://m.tb.cn/h.8EbY9YU" rel="nofollow noopener">https://m.tb.cn/h.8EbY9YU</a> 【新品】科沃斯X12S PRO扫地机器人滚筒活洗3.0全自动扫拖一体<br>
<a href="https://u.jd.com/4Dcd3RZ" rel="nofollow noopener">京东链接</a><br>
<strong>本期福利：下单备注【硅谷101】额外加赠抗菌滚筒拖布一个</strong><br>
把家务交给科技，享受属于你自己的惬意生活吧！</p>

<p><strong>【硅谷AI视频黑客松招募】</strong><br>
最懂内容的影视团队，与最懂AI的一群科学家，在硅谷相遇，会碰撞出如何的火花？<br>
今年，硅谷101把一次现场创作实验带到 Alignment 2026：STORY101 LAB — AI Storytelling Challenge。我们邀请你用AI，完成一部不超过三分钟的视频作品。<br>
比赛设【探索组】与【专业组】双赛道，资深AI影片团队与零基础新手皆可参与。我们提供免费workshop培训，优胜者更可获丰厚奖金与千人线下展映机会。<br>
时间：2026年10月10–11日<br>
地点：Sunnyvale, California<br>
<a href="https://luma.com/STORY101LAB" rel="nofollow noopener">报名入口</a></p>

<p><strong>【硅谷101年会来了，线下见】</strong><br>
10月10日—11日，我们将在【硅谷】举办Alignment 2026年度大会，从大模型、Agent、机器人到AI Infra，从实验室里的突破，到真实世界的商业化，我们直击AI变化最剧烈的前沿。来自OpenAI、Anthropic、NVIDIA、Meta、Google DeepMind、SemiAnalysis、Cerebras等公司的研究者、创业者与投资人将齐聚现场，分享正在发生的机遇和挑战。<br>
<a href="https://luma.com/alignment2026?coupon=FANS15" rel="nofollow noopener">点击报名入口</a> ，使用折扣码【FANS15】注册，还可以获得15%折扣。<br>
<img src="https://imagev2.xmcdn.com/storages/2ba3-audiofreehighqps/2A/C2/GKwRIMAOiYvRAAU2TgTcPavv.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""><br>
<img src="https://imagev2.xmcdn.com/storages/97f3-audiofreehighqps/2B/1F/GAqhaTsOiYwcAC6GIATcPcg0.png!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<p><strong>【相关阅读和名词解释】</strong><br>
Rubric（评分标准）：针对具体任务制定的一组评价条件，用来判断回答或工作成果是否达到要求。它可以包含正确性、完整性、指令遵循等维度，也可以融入专家判断。<br>
RL Environment（强化学习环境）：让模型通过行动和反馈进行学习的环境。在本期讨论的Agent训练中，通常包括任务、可操作的软件与工具，以及判断任务是否完成、完成质量如何的验证和奖励机制。<br>
Benchmark（评测基准）：通过一组任务与评价规则，衡量模型或智能体在特定能力和场景中的表现。评测数据与训练数据需要保持适当隔离，才能有效检验模型面对新问题的能力。<br>
Reward Hacking（奖励投机）：模型利用评分机制的漏洞获得高分，却没有真正完成预期任务。例如，绕过正常操作修改结果，让验证程序误以为任务已经成功。<br>
<a href="https://github.com/rdi-berkeley/agents-last-exam" rel="nofollow noopener">Agents’ Last Exam（ALE）</a>：由Berkeley RDI与行业专家共同构建的智能体评测项目，关注具有经济价值、需要多步骤执行且结果可验证的专业任务。<br>
<a href="https://scale.com/blog/humanitys-last-exam-results" rel="nofollow noopener">Humanity’s Last Exam（HLE）</a>：由Center for AI Safety与Scale AI共同组织推出的评测，覆盖数学、人文、自然科学等领域的高难度专家问题。<br>
<a href="https://labs.scale.com/papers/sweatlas" rel="nofollow noopener">SWE Atlas</a>：Scale推出的软件工程智能体评测套件，覆盖代码库问答、测试编写和代码重构。<br>
SWE-bench Verified：经过人工审核的软件工程评测，让模型修复真实开源项目中的问题。<a href="https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/" rel="nofollow noopener">OpenAI于2026年2月宣布停止报告其分数</a>，指出测试设计缺陷与数据污染影响了它衡量前沿模型能力的有效性。</p>

<p><strong>【硅谷101听友群】</strong><br>
在这里，和同好一起深聊科技、商业与未来，期待你的声音，也期待更多有趣的讨论。<br>
扫码加入，即刻相遇！<br>
<img src="https://imagev2.xmcdn.com/storages/9a3c-audiofreehighqps/8B/AE/GAqhaTsOjuZEAAOMJgTeo_iN.jpg!op_type=4&amp;device_type=ios&amp;upload_type=attachment&amp;name=mobile_large" alt=""></p>

<p><strong>【监制】</strong><br>
泓君<br>
<strong>【后期】</strong><br>
Amei<br>
<strong>【运营】</strong><br>
朱婕<br>
<strong>【BGM】</strong><br>
Mindscape - Lennon Hutton<br>
Light-Footed - Bonnie Grace<br>
Smiling Neighborhood - Claude Signet<br>
Ruffles and Rust - Fabien Tell<br>
Reclaim - Megan Wofford</p>

<p><strong>【在这里找到我们】</strong><br>
公众号：硅谷101<br>
收听渠道：Apple Podcast｜Spotify｜小宇宙｜喜马拉雅｜蜻蜓FM｜荔枝FM｜网易云音乐｜QQ音乐<br>
其他平台：YouTube｜Bilibili 搜索「硅谷101播客」<br>
联系我们：<a href="mailto:podcast@sv101.net" rel="nofollow noopener">podcast@sv101.net</a></p><p>Special Guests: 何允中 and 孙一铀.</p>]]>
  </itunes:summary>
</item>
  </channel>
</rss>
