Logan Kilpatrick 认为,围绕深度模型 benchmark 和 evals 做短中长期投资判断,已经足以支撑一家顶级 VC。核心是发现 capability overhang 和模型短板轨迹。
X 日报个人阅读
2026 年 6 月 7 日 · 周日
2026-06-06 08:00 至 2026-06-07 08:00(北京时间)
关注账号覆盖
条入选
个主题
晨间播报
这一期没有生成音频。
编辑导言
这一天的可核验信号集中在三个方向:AI 评测开始从研究工具变成投资和产品判断的基础设施,AI coding 正在向电脑操作、邮件处理和工程发布链路扩展,研究机构也在用转推把前沿 benchmark 和视觉推理工作放到关注列表里。
样本并不完整。部分账号在早期抓取中返回过结果,但没有留下可复核原始响应;我没有把这些记忆内容写进主报告。最终只使用当前可读取的 AgentKey 原始响应和本轮可见返回体,低信号与缺口在审计文件中逐项说明。
01基准测试成为投资雷达
AI benchmark 和 evals 不再只是研究工具,开始被视为判断模型能力外溢和创业机会的投资基础设施。
他进一步说,每家风投都应该有 evals 与 benchmark 团队,持续把模型拉出来实测,并自行构建新的评测体系。
Logan 判断顶级投资机构全面采用这种模型评测驱动投资方法只是时间问题。
02AI 工程从辅助走向操作系统
AI coding 的讨论从写代码扩展到 PR、测试、发布、电脑操作和邮件工作流,重点变成工程系统如何被 AI 接管。
Bindu Reddy 说团队几乎全天与 AI 交互,代码、PR review、测试和生产发布都高度依赖 AI。
Greg Brockman 直接评价,用 Codex 操作电脑变得更有趣,说明 Codex 的叙事已经从编码工具转向计算机工作入口。
Zack Korman 讽刺企业不知道开发者拿 AI 干什么,真实答案可能是开发者在做个人 side project,点出了企业 AI 支出治理的盲区。
03AI 产品进入办公界面
ChatGPT 邮件集成、Microsoft AI assistant 讨论和产品留存争议显示,AI 正在从独立聊天框迁入办公流。
Greg Brockman 转述 ChatGPT 的邮件集成功能,强调 AI 助手开始进入真实办公流,而不是只停留在对话框里。
Zack Korman 评论 Microsoft 新 AI assistant 时指出,让用户回来本来就是产品目标,也就是 retention;真正问题是 Microsoft 的产品体验可信度。
04研究机构传播前沿方法
Stanford 与 Berkeley 的窗口内更新主要是转推研究成果,关注代码生成 benchmark、科学生成模型和 CVPR 视觉推理。
Stanford AI Lab 转推 ProgramBench,强调 whole-repository generation benchmark 让 agent 自主选择需要修改的文件。
Stanford AI Lab 转推科学生成模型方向,用 unpaired data 到 data 的任务替代传统噪声到数据生成。
Berkeley AI Research 转推 Video-GMAE,关注无轨迹标签视频中学习 correspondence 的问题。
Berkeley AI Research 转推 CVPR 工作,强调在视觉 latent bottleneck 中进行推理可提升模型表现。
低信号与抓取缺口
本轮可复核成功账号 13/52 个,失败或无法恢复账号 39 个。窗口内 raw posts 共 23 条,其中不少来自转推;主报告只选取可核验且语义清晰的非转推或强信号帖子。无法恢复的账号已逐一写入 x_fetch_audit.json,不使用记忆里的候选内容冒充抓取证据。