视频学习笔记
← 返回未分类
YouTube🗂️ 未分类00:56:592026-09-16观看原视频 ↗

Builders&Breakers | Building Hackbots: Models, Harnesses and Human Expertise with Hamid Kashfi

整体摘要

本期是 Builders & Breakers 播客首期节目,主持人与资深安全研究员 Hamid Kashfi(现就职 Expo,曾任职 Trail of Bits 与 Immunity)围绕"黑客机器人(Hackbots)"展开深度对谈。核心论断:在所有人使用几乎相同的 3-5 个公开模型、审计同一批代码库的今天,产出差异来自"如何运用工具"——"只有 20% 是模型,80% 是利用模型的 harness(工程)"。节目覆盖:Hackbot 的工厂化解构(侦察/利用);反直觉的基准测试结论(对最新模型强制工具清单与执行步骤反而降低产出质量);在家研究与企业交付之间的工程化鸿沟(成本、合规、审计黑洞、子代理撞护栏);漏洞永不枯竭的统计学论证(Code White 白皮书 60-70% 缺陷率 + 动态代码变更概率 + 新漏洞类型);行业身份从破坏者到建设者的转变与"十倍黑客"黄金窗口期;以及不可替代的人为因素——提问资格(医学术语提问使诊断提升 70% 的类比)、先建上下文再挖洞的深层方法论(戴尔显示器协议逆向案例);最终以开放模型民主化与拆除不合理护栏的愿望清单收尾。

01

开场与"黑客机器人时代"的来临

00:00 - 07:24

播客首期开场,主持人 Stuck 与 Coug 介绍嘉宾 Hamid Kashfi,提出"黑客机器人时代"与"漏洞末日"(bug-mageddon)概念;Hamid 给出核心论断:能力 = 工具 × 使用者,结果差异同时来自模型与人。

关键时间节点
时间类型说明
00:40背景信息播客首期开场,定位为"高速建设与破坏者"的对话,赞助商 Senity
01:42核心概念"我们正在进入黑客机器人时代"——网络安全的新阶段,从进攻视角切入
02:03背景信息嘉宾介绍:Hamid Kashfi,安全研究员,现于 Expo,背景 Trail of Bits / Immunity
03:06核心概念"漏洞末日"(bug-mageddon):公开漏洞与未公开私人漏洞同时大幅激增
03:27核心概念Hamid 核心框架:一切与工具及谁使用工具有关,二者结合形成"能力"(capability)
04:10重点结论当前模型可自我改进、衍生子工具,但仍显著地由人驱动
04:52关键案例同样的模型、供应商、构建模块 → 同一代码库发现完全不同的漏洞
05:15关键案例同级别资深漏洞猎人在同一代码库(如 EngineX,疑指 NGINX)发现 12 个不同的严重漏洞
05:58重点结论结论:产出差异既非纯模型、也非纯人,而在于如何运用工具(harness 层)
06:20关键步骤时间线校准:7 个月前模型几乎无产出;约 6 个月前(New Year's Eve 前后)模型开始真正发现/利用漏洞
07:02背景信息Hamid 自述用 LLM 找 bug 已近 3 年;现在 LLM 接管繁重工作,人/harness 的投入比例彻底改变
详细内容

播客定位与嘉宾:本期是 Builders & Breakers 首期录制(主持人 Stuck、Coug,研究合作伙伴 Senity)。主题锁定"进攻性安全进入黑客机器人时代"。主持人对 Hamid 的评价极高,称其为当下最好的安全研究员之一。

"漏洞末日"之问:公共 CVE 与私人囤积漏洞双双激增(bug-mageddon),主持人抛出本期核心问题——黑客机器人时代会不会把漏洞潮演变成数据泄露灾难?漏洞与数据泄露之间是否必然关联?

Hamid 的能力公式(本期理论基石):

  • 过去:更依赖人,工具由人开发,上限取决于写工具的人的技能与经验。
  • 现在:出现一种能自我改进、自我衍生子工具的强大工具(LLM),但仍由人驱动。
  • 证据一:大家用同样的模型、同样的供应商、几乎相同的构建模块,却在同一代码库中挖出完全不同的漏洞。
  • 证据二:同一代码库(例如 EngineX)、同样都是经验丰富的经典漏洞猎人,却各自发现 12 个不同的严重漏洞。
  • 结论:差异既不完全来自模型(模型相同),也不完全来自人(人都资深),而来自"如何运用工具"——这正是本期标题中 Models / Harnesses / Human Expertise 三要素的引入。

时间线与个体经验:Hamid 提醒这类话题"科幻与现实混合",6 个月后结论就会过时;他自己用 LLM 找 bug 近 3 年,但真正的转折点约在 6 个月前(New Year's Eve 前后)——模型开始真正擅长发现与利用漏洞,行业进入加速阶段:LLM 做繁重工作,人做驱动。

02

黑客机器人的"工厂":侦察与漏洞利用

07:45 - 11:15

将对 Hackbot 的解构按"工厂"划分——侦察工厂与漏洞利用工厂。侦察已从自写 Go/Python 确定性脚本+分布式 Droplets,变成模型自主运行、自主决策、自动写报告;数据采集空前容易,但代价是失去长期追踪目标形成的深度直觉,因此必须用结构化笔记(Obsidian)补偿 AI 的记忆缺陷,并以 ROI 视角评估每条路线。

关键时间节点
时间类型说明
07:45核心概念提出"制造黑客机器人的不同工厂"框架,从侦察(recon)阶段切入
08:07重点对比侦察之变:过去自写 Go/Python 脚本、持续确定性运行、经分布式 Droplets 大规模铺开
08:50重点对比现在:本地模型/集群持续运行,自主决策、自动出报告,人负责审读与后续——采集数据变得非常容易
09:10关键步骤侦察成果的杠杆点:确定目标框架/组件版本,可放大下游(漏洞利用)工厂的产出
09:31核心概念漏洞利用工厂:过去人工细致分析网络与信息收集结果;现在让模型跑数天侦察后直接给结论
10:14警示代价:失去长期追逐目标才有的"哪里不对劲"的深度直觉;盲目信任系统输出的拼接会翻车
10:35核心概念AI 的根本弱点是记忆——它会忘事;必须制定"记录所做事情"的计划
10:55关键步骤工具建议:用 Obsidian 等结构化工具记录观察、事后回看;借助模型判断哪条路线最有价值
11:15重点结论"每项投资都有 ROI,token 就像货币"——侦察路线选择是投资决策
详细内容

工厂框架:主持人提议按"工厂"解剖 Hackbot:侦察工厂 → 漏洞利用工厂(后续还有更多环节)。

侦察工厂的今昔:

  • 旧模式:写 Go/Python 脚本或应用,行为持续确定,通过大量分布式 Droplets 跑规模化扫描。
  • 新模式:在本机跑最高订阅额度的模型,或构建本地模型集群;模型持续运行、投喂数据、自己做决定、甚至代写报告——人退到"审读一切"的位置。数据收集与获取已极其容易。
  • 保留判断:即便数据唾手可得,人仍要能说出"这里有一个漏洞(v)"——即人工确认环节不可省。

版本指纹的价值:能确定目标 Web 应用所用框架的版本,就能让下游工厂产出更好的结果——侦察的产出质量直接决定利用阶段的天花板。

漏洞利用工厂的今昔:过去靠人工消化网络信息、逐步细致分析;现在可以指示模型"花几天做侦察收数据",回来直接得到"他们在用 X,这很有意思"的结论,帮助快速理解问题范围。

被牺牲的深度:Hamid 指出一个被忽视的代价——长时间人工追逐目标获得的直觉("感觉某些地方不对劲")正在消失,因为你只是信任系统给出的"完整输出"并拼接结论。主持人接话:AI 的结构性问题始终是记忆,它记性差。补救方案:

  1. 从小养成写笔记的习惯(便签 → 结构化记录);
  2. 用 Obsidian 类工具记录渗透/赏金过程中的观察,供日后回看;
  3. 用模型复盘记录,判断哪条路线 ROI 最高——"每项投资都有回报率,token 就是货币"。
03

从"强制工具清单"到"放手让模型探索"(反直觉基准测试)

11:37 - 18:04

本段是全片最重要的反直觉结论。过去提升 Hackbot 产出的方法是给模型规定工具清单和执行步骤(nmap、指定 Ghidra 插件、固定侦察流程),这在三代前的 SOTA 模型上有效;但在最新模型上重复同样的强制约束反而降低产出质量。Hamid 用"埋 100 个漏洞"的内部基准说明:旧的强约束 harness 会过时,两年不重构就会被淘汰。同时要认清确定性与不确定性的界限:模型本质上非确定,规模化商用与在家当爱好是两回事。

关键时间节点
时间类型说明
11:37背景信息回顾旧范式:搭测试框架,用 LLM 调度大量确定性脚本/工具,收集结果再分析
12:17核心概念指挥方式的转变:过去要预先定义 Hackbot 可用的工具集(nmap、静态分析、Ghidra 逆向、专用脚本)
12:38重点结论旧逻辑:限制越死,token 消耗越少、结果越可预测
12:58关键步骤Hamid 的内部基准测试与实验:不应再强制限制模型的执行方式
13:20核心概念反直觉结论:三代前 SOTA 上的性能优化方法,如今复用会降低模型能力
13:43关键案例"埋 100 个漏洞"基准:旧模型+旧方法可找到 90 个;强制"必须用 nmap/必须用指定 Ghidra 插件/必须按固定步骤侦察"在新模型上产出更少、质量更差
14:26警示行业警告:仍在用两年前的框架/代码库/结构的 LLM 黑客"将会过时",且不会察觉——误以为是自己技能退步
15:08重点结论真因:你的 harness 没跟上模型进化速度;有时必须推倒重来(模型的记忆机制都变了)
15:52核心概念呼应"放松结构":减少对工具的控制,反而能从任务中获取更多价值
16:14核心概念但非"躺平":模型本质非确定——同样问题、同样配方重复 100 次会得到 99 个不同结果
16:35重点结论规模化可预测运行的技巧在:框架设计、提示设计、结果监控捕获、轨迹审计(audit trajectory)
16:56重点结论"在家当爱好做一次性项目"与"大规模生产"完全是两回事;用例与规模决定变量
17:40关键案例Hamid:独立研究者的做法 80% 在工业场景不必要(反之亦然);单机一天内可出好漏洞,同样方案跑 500-1000 次客户渗透测试会朝 1000 个方向发散——完全不可靠
详细内容

旧范式回顾:为让 LLM 达成目标(发现漏洞/寻找目标),过去的标准做法是搭建测试框架:LLM 调度大量确定性工具与脚本(运行 nmap、静态分析、用 Ghidra 做逆向、跑常用重复任务),收集结果再分析得到预期/非预期输出。逻辑是:约束越死 → token 越省 → 结果越可预测。

基准测试的颠覆性发现:Hamid 在做内部基准与实验,结论是"不应再强制和限制模型如何执行任务":

  • 实验设计:代码库中埋约 100 个已知漏洞来度量 Hackbot 的召回。
  • 三代前的 SOTA 模型:强制工具清单+明确步骤的方法表现良好(旧模型能找到约 90 个)。
  • 最新模型(GPT-5.6、Sonnet 等):重复同样的强约束场景,产出数量更少、结果集不同、质量低于预期。

"过时"警告(本段金句):如果做 LLM 黑客(为赚钱或为生意)仍沿用两年前相同的框架、代码库和结构——"你将会过时……你可能根本不会注意到发生了什么:你觉得别人都找到了好东西而你找不到,你以为技能退步了。现实是你的 harness 没有跟上模型发展的速度。"有时甚至必须从头重建,因为两年搭建的东西可能已不匹配最新模型的功能或其内存/记忆跟踪方式。

确定性的微妙界限:放松约束 ≠ 放任不管。模型本质非确定(同题同配方 100 次得 99 种结果),想要大规模、可预测、可靠,就要在框架构建、提示设计、结果监控与捕获、轨迹审计上更下功夫。家用一次性项目 vs 规模化生产是完全不同的命题,用例与规模决定一切变量。

04

在家 vs 在企业——Hackbot 工程化的残酷现实

18:45 - 28:30

以"在家研究"与"在企业/客户环境"两个世界对比:在家自由试错(VM 快照兜底、无需问责),但受赏金范围与目标纪律约束;企业环境则要面对客户投诉、越界行为、结果审计、不确定性导致的报告失真、成本与可用性,以及子代理撞上模型护栏后结果"无声消失"等问题。Hamid 给出两个量化判断:90% 想把 LLM 当服务卖的创业者没想清楚这些细节;现实中"20% 是模型,80% 是 harness"。并以 WordPress 核心 RCE 为例说明同模型同代码库仍会产出差异化漏洞。

关键时间节点
时间类型说明
18:45核心概念引入"护栏"话题:扫描互联网可放开跑,但 Hackbot 还需要能模仿目标环境的另一个"飞轮"(如逆向补丁、找 0day)
19:43核心概念两个世界的框架:在家 vs 在 Expo(企业),比较模型的限制与自由度
20:10关键步骤在家:随意试错、VM 快照还原兜底、时间充裕、无需向任何人负责
20:31警示在家的纪律边界:目标是 x.com 就绝不能漂移到 z.com——超出赏金范围=白干+无收入;组件偏离市场需求同样无收入
21:32警示企业侧风险:偏离范围客户立刻投诉("你的模型把我们的产品网站搞垮了")
21:56关键案例审计黑洞案例:模型上传 web shell 又删掉,最终报告却无已确认漏洞——"那东西在哪儿?"
23:01警示非确定性后果:同一流程跑 5 次得 5 个结果;不留痕迹(diff notes)则实际确认过的问题可能最终不被认定为漏洞
23:43核心概念新颖路径漏报:模型用你未监测的新方法达成同样结果时,你的监测/确认体系会错过它
24:27重点结论企业清单:成本、客户负担、可用性、政策合规、模型护栏——全部要纳入设计
24:48警示子代理撞上 Opus/GPT 护栏:若无确定性代码检测并重试,该子代理及其结果"基本就消失了"
25:29重点结论把 LLM 当 SaaS 交付,所有小问题必须被解决、协调并完美配合才成立
25:51重点结论判断一:90% 把 LLM 视为商业服务方式的创业者没在脑中考虑这些细节
26:13关键案例Hamid 自省:也曾以为"家庭实验室测试完美的提示打包→卖报告"可行,实际很快翻车——该方法无法扩展、不可靠
27:17核心概念判断二(本期标题点题):"目前只有 20% 是模型,80% 是利用模型的工程(harness)"
27:39重点结论所有人都在用公众可得的 3-5 个模型 + 同一套被反复审计的代码库,结果却截然不同
28:01关键案例WordPress 核心案例:被公认为已被最新模型反复审计、无问题的组件,仍有人挖出"快速简便的 RCE"(英文原话 quick easy RC/RCE,WordPress core 的 R 最终变成 RC)
详细内容

护栏与飞轮:讨论从"给某事设护栏"延伸:扫描互联网类任务可以放开(能检测到目标即可),但 Hackbot 需要另一个"飞轮"——能模仿目标环境、通过逆向补丁或找 0day 自由确认利用可能性。

在家(自由世界):

  • 想出主意就敲键盘,出错就还原测试 VM 快照,重来即可;时间充裕(除非宝宝早上 5 点把你叫走)。
  • 不用向任何人负责,防护措施有限——但这里的"护栏"不是 LLM 政策护栏,而是目标纪律:目标是 x.com 就绝不能让模型转向 z.com(超出赏金范围 → 即使做成了也拿不到钱)。
  • 组件纪律:在无市场需求的组件里发现漏洞同样意味着没有收入。东西坏了自己修,最坏按电源重启。

在企业/客户环境(受限世界):

  • 偏离申请表上的工作范围,客户立刻打电话投诉:"你的模型在戳别的东西?"
  • 破坏性事故:"你的模型把我们的产品网站搞垮了。"
  • 审计黑洞:模型成功利用漏洞、上传了 web shell 又删除,但最终报告没有任何已确认漏洞——客户看到了过程却没看到结论。
  • 观察与确认高度依赖人脑(除非外包给经理/机器人老板);非确定性让"重复 5 次 = 5 个结果",不留对比笔记(diff notes)就会丢失实际确认过的发现。
  • 新颖路径漏报:模型自创方法达到同样结果时,为旧偏差调校的监测/解释体系无法识别,最终错过成果。
  • 企业必须考虑:成本、客户负担、可用性、枯燥的政策合规、以及各级模型护栏——子代理执行中可能撞上 Opus/GPT 的护栏(启动者意想不到),若没有确定性的检测/重试/复现工具,该子代理及其结果基本无声消失。
  • 高空俯瞰全是"小问题",每一个都可能毁掉结果;所有环节必须完美配合,才能以 SaaS/"LLM 即服务"的商业模式交付。

两个量化判断:

  1. "90% 的创业者(或把 LLM 视为商业服务方式的人)没有在脑海中考虑这些细节。"Hamid 自曝也犯过:以为家庭实验室里完美运行的提示词打包出售即可——很快出大事,因为该方法无法扩展、不可靠;人们低估了企业级 LLM 安全服务背后的工程投入。
  2. 点题金句:"即使是目前的模型,也只有 20% 是模型,80% 是利用模型的 harness。"因为大家都在用大致相同的模型(少数公司有更高权限/更少限制的版本,但忽略这点,几乎所有人都在用公众可得的 3-5 个模型之一),代码库也几乎被所有团队反复审计过——结果却天差地别。WordPress 核心组件的 RCE(原话:quick easy RC,R 最终变成 RC)就是明证:所有人都以为"最新模型审计过=没问题",仍有人挖出了快速简便的 RCE。
05

漏洞会枯竭吗——持续涌现的三个因素与新漏洞类型

28:31 - 32:48

回应"bug 是否有限、是否存在尽头"之问,Hamid 将其定性为统计学/科学测量问题,并否定"好模型多→脆弱点终将被穷尽修复→一切恢复正常"的乐观论。给出漏洞持续涌现的因素:人为因素、LLM 生成代码的缺陷率(Code White 白皮书:60-70% 含漏洞)、动态代码每次变更引入新缺陷的固定概率;外加新漏洞类型:模型已开始发现"新的漏洞类型"而不仅是新漏洞实例。

关键时间节点
时间类型说明
28:31核心概念问题提出:"bug 的范围是否有限、是否存在尽头"——看似愚蠢,实为统计学/科学测量问题
28:54观点对比乐观论(Hamid 的朋友们也持此见):模型足够好→所有脆弱点被发现修复→回归正常;Hamid 不同意
29:37关键文献Code White 团队去年发布的白皮书(在 LLM 领域一年已是"远古"结果):LLM 助手/IDE 生成代码约 60%-70% 存在漏洞
29:58警示该数据击穿"同一模型既能发现漏洞就不该写出漏洞代码"的信念;缺陷率会降低但不会归零——"只要不为零,我们就还在营业"
30:41核心概念静态代码 vs 动态代码:静态代码库逐步演化也会引入约 5%-7% 的变更,但静态代码终将穷尽——几乎所有有趣的 bug 都会被发现
31:23核心概念现实代码全部是动态的(每周甚至每天更新),每次变更都有一定比例/几率(Hamid 口中约 5%-10%,自注"随手编的数字")引入新漏洞
32:05核心概念第四因素:新漏洞类型——模型已强大到能发现新的漏洞类型(而不仅是新漏洞本身),少见但一旦发生就是巨大突破
32:28背景信息语境:三个月前"安全研究停滞"的说法是指在既有漏洞类型的探索上落后;而黑帽大会(Black Hat)近期已有研究探讨模型何时能开始发现并推断新漏洞类型
详细内容

问题定性:漏洞是否有尽头不是玄学问题,而是统计学与科学测量问题。

乐观论与其反驳:不少从业者(包括 Hamid 的朋友)认为模型变强后所有脆弱点终将被发现并修复,行业"恢复正常"。Hamid 明确不同意,理由如下。

漏洞持续涌现的三个因素 + 一个增量:

  1. 人为因素始终重要(详见章节 8)。
  2. LLM 生成代码的缺陷率:Code White 白皮书(去年发布,按 LLM 领域速度已算"远古")指出 LLM 助手/IDE 生成的代码约 60%-70% 存在漏洞。这直接违背"用你的代码编写代码、同一模型能发现漏洞因此不该写出漏洞代码"的直觉。Hamid 判断该比例会下降但永不为零——"只要不为零,我们就还在营业"(安全研究者的饭碗还在)。
  3. 代码的动态性:静态代码库会收敛——哪怕通过人工/模型逐步开发引入了 5%-7% 的变更,对固定的静态代码你最终能发现几乎所有有趣的 bug;但现实世界所有代码都是动态的,每周甚至每天都在更新,每次变更都有一定概率(约 5%-10%,Hamid 自注是凭印象的数字)引入新漏洞——漏洞涌现因此永不停止。
  4. 新漏洞类型(增量):模型如今已强大到能发现"新的漏洞类型"而非仅仅新漏洞实例。这类探索目前少见、但极其有趣;黑帽大会上已有相关研究发表,Hamid 相信这趋势会持续。
06

从破坏者到建设者——身份转变与"十倍黑客"的黄金时代

33:10 - 37:51

主持人引述 Coug 的博客勾勒行业身份变迁:黑客→渗透测试员→英雄→脚下土地被撕裂,"现在我们都变成了建设者"。面对"顶级渗透测试员如何自处"的提问,Hamid 坦言既谦卑又恼火(为没看到的东西惭愧、为浪费时间的无意义工作恼火,像当中层经理);而曾经"难以下咽的药片变成糖果"——需要数月逆向专有协议的任务现在触手可及。"10 倍开发者"的梗进化为"我们都是 10 倍黑客",但这是千载难逢、不会持续太久的窗口期(1-3 年后曲线趋平、市场饱和)。

关键时间节点
时间类型说明
33:10背景信息引述 Coug 的博客文章梳理身份变迁:像罪犯一样用黑客技术→变成渗透测试员→成了英雄→梦寐以求的干净工作
33:32核心概念转折:"脚下的地被撕裂,模型做事比我们好得多——现在我们都变成了建设者",用多年经验+模型做全新研究
34:16关键提问对顶级渗透测试员的灵魂之问:如何看待自己、自我与"破坏者"角色?
34:36重点结论Hamid 答一:既谦卑又恼火——为没看到的事情谦卑,为把时间浪费在无意义的事情上恼火;像被迫当中层经理,如今上班更多感到谦卑
35:22重点结论另一答(同侪):回顾错过的东西感到惭愧,但对尝试新事物充满好奇,研究清单无穷无尽
36:03核心概念"曾经难以下咽的药片如今变成糖果":需要顶级逆向能力+数月专有协议逆向的任务,现在触手可及
36:26背景信息Hamid 加入 Expo 的原因之一:把爱好与兼职变成了正式工作
36:48核心概念"10 倍开发者"的梗→"现在我们都是十倍黑客":人人有想法,只是缺时间/预算/技能
37:08重点结论承认不擅长某事完全OK;当前是"千载难逢的良机",但窗口有限
37:30警示窗口期预判:1-3 年后增长曲线趋平、市场逐渐饱和——趁黄金时期充分利用长期积累的兴趣爱好
详细内容

身份变迁史(Coug 博客):这个行业的人过去像罪犯一样使用黑客技术,然后变成渗透测试员,然后成了英雄;这是一份梦寐以求的、干净整洁的工作,做大量很酷的研究。然后"突然间脚下那块地就被撕裂了"——模型做事比我们好得多,"现在我们都变成了建设者":必须建造装备(harness),把多年积累的经验叠加模型运用到全新的研究上,使自己比以往任何时候都更有能力。

情感的两面:

  • Hamid:既谦卑又恼火——为自己没看到的事情谦卑,为把时间浪费在无意义的事情上恼火;被迫当中层经理般恼火,但如今上班更多感到谦卑。
  • 同侪:回顾错过的东西惭愧,但因好奇尝试新事物而过得开心,研究清单没完没了。

药片变糖果:有些待办事项当初写下时根本没有能力做到——需要成为非常优秀的逆向工程师、需要对专有协议底层原理的极深理解,可能要花数月逆向才能弄明白;那些"曾经难以下咽的药片现在都变成了糖果,可以吞咽、食用并享受"。这是 Hamid 加入 Expo 的原因之一:把爱好变成工作。

十倍黑客与窗口期:"10 倍开发者"在 vibe coding 时代变成一个梗——"现在我们都是十倍黑客",因为人人都有想做的事,只是没时间、没预算或没技能。坦白承认自己不擅长某件事完全OK(不是人人都能样样精通专家级)。现在能力在手中,Hamid 称之为千载难逢的良机——因为这时期不会持续太久:或许一两年、三年后增长曲线趋平、市场饱和。趁黄金时期充分利用积累已久的兴趣爱好。

07

解锁不可能的任务——2000 篇论文案例与即时加固循环

37:51 - 43:53

两个"曾经不可能、现在几天完成"的实证案例。Hamid 的网络战研究需要阅读并理解 2000+ 篇论文/资料(人工需约两年全职),用旗舰模型(原音 Soul Ultra)烧 token 四五天完成。同侪侧则描述了护栏加固的人机循环:搭完整测试平台跑评估→发现绕过→即时写硬化规则→重跑→定期生成报告供人审阅,并把自己 20 多年咨询经验与基础设施全部喂给模型。最后以医疗研究作类比:医生用既定术语提问可使诊断结果提升 70%——提问资格就是专业经验的价值。

关键时间节点
时间类型说明
38:13背景信息Hamid 长期监控中东/伊朗威胁行为者与网络靶场,从技术+政治视角研究网络战的发生方式/原因及网络强国的形成
38:56关键案例设想中的研究需要阅读理解 2000+ 篇论文与资料、做笔记、得出结论——人工估算约两年全职(即使大脑和 Obsidian 也存不下这么多细节与分支)
39:37关键案例几周前决定交给旗舰模型(原音 "Soul Ultra")烧 token 处理:四五天完成全部内容——"一直想做却从未有机会做的庞大艰巨任务"
40:19重点结论金句:遥不可及的大目标现在触手可及——"你不再能以'我没时间''我做不到''这太复杂了'为借口",新手也能立刻行动
41:03关键步骤同侪的对应实践:搁置多年的研究项目现在交给 agent 着手处理;其本职就是搭护栏、拆解模型与"笼子"、用代理方案加固
41:24关键步骤即时加固循环:搭完整测试平台→跑评估→"你绕过了这一步?完美。写出硬化规则。再来一次"→循环往复→定期生成报告供人审阅
41:46重点结论把 20 多年行业经验与整套咨询基础设施喂给模型("因为它不知道该问什么");人工驱动+完全自动化结合,人负责判断与批评("能帮我试试吗?能绕过这一步吗?")
42:29关键文献跨域类比:一项关于用 LLM 自我诊断的医疗研究
43:13重点结论核心数据:医生/受过教育的人用既定医学术语向模型提问(而非随口问"我是否患癌"),同一份实验室报告的诊断结果提升 70%
43:33重点结论迁移到安全领域:用既定术语与方法论提问=专业提问资格;Hamid 也在 Farsy 平台近期录制的视频中谈过此观点
详细内容

案例一:2000 篇论文的网络战研究:

  • 背景:Hamid 除了技术侧研究,还长期从中东/伊朗视角监控威胁行为者与网络靶场(收发攻击程序),研究网络战的发生方式与原因、政治因素、各国如何成为网络强国或目标。
  • 难题:设想的一项研究需阅读理解 2000+ 篇论文与资料、做笔记、得出结论——人工需约两年全职,且即使大脑能处理、Obsidian 能存下所有细节与分支,也未必能得出结果。
  • 破局:几周前决定"这是烧 token 的好任务"(原音 Soul Ultra,旗舰模型),只用四五天处理完全部内容。"我知道这会发生,但这对我仍是非常重要的时刻。"
  • 引申:心中遥不可及的大目标现在触手可及——"你只需把它提示掉"。你不再能以"没时间/做不到/太复杂"为借口,哪怕刚入行也能立刻行动。

案例二:护栏加固的人机循环(同侪实践):

  • 岗位即"搭护栏":拆解模型、研究"笼子",用代理(agent)与类似方案加固。
  • 循环:搭建完整测试平台→运行评估→发现绕过("哦,你绕过了这个步骤。完美。")→即时写出硬化规则→重跑→一遍遍重复→时不时生成报告供人审阅。
  • 经验注入:把 20 多年行业经验与建立的整套咨询基础设施告诉模型——"因为他们不知道该问什么"。形态是人工驱动+完全自动化结合:模型疯狂生成报告,人做判断与批评("嘿,或许我们也可以这样做""你能帮我试试吗?你能尝试绕过这一步吗?")。

医疗类比:提问资格的价值:一项关于 LLM 自我诊断的医疗研究显示:医生/受过教育者用既定医学术语与方法论提问("是否患有这种特定疾病"而非普通人式的"我是否患有癌症"),对同一份实验室报告可获得提升 70% 的更准确诊断。这个规律同样适用于安全领域——会用领域术语与方法提问,正是专业经验未被替代的部分。(Hamid 亦在 Farsy 的近期视频中谈及)

08

人为因素——提问资格、深层方法论与戴尔显示器案例

43:53 - 49:57

直面新手之问"模型都写代码了,我还要学编程吗、任何人都能当黑客吗"——答案是否定的:没有 20 年人工解题经验,你不知道该问什么问题、不知道看威胁模型的哪个部分,这正是人类依然脱颖而出的地方。老手看产品描述即可脑补五个最可能藏洞的组件,而裸提示只能找到别人找过的浅洞。Hamid 分享其深层方法论:先让模型为目标协议编写兼容的协议客户端/解析器并验证有效、完全不问安全问题,之后再下令找漏洞——结果截然不同。戴尔显示器案例完整演示了"先建上下文,再挖深洞"的威力。

关键时间节点
时间类型说明
43:53关键提问新手之问:想做黑客/安全,还需要学编程吗?模型几乎写了所有代码,"任何人都能成为黑客/安全专家"?
44:36重点结论Hamid 的答案:否——从所有可衡量指标看,没有 20 年人工解题经验,你甚至不知道该问什么问题
44:57核心概念经验的价值定位:不知道该看组件/软件/架构/威胁模型的哪个正确部分——"这就是人为因素所在,是人类依然大放异彩的地方"
45:18关键步骤老手直觉:看一款软件或听产品描述,不看代码也立刻浮现五个最可能藏漏洞的关键组件、开发人员偷懒之处、解析器漏洞等
45:38重点对比反面:把软件扔给模型说"找关键漏洞"——或许能找到一些好东西甚至 RCE,但大多不是深洞,都是别人已找到的
46:21核心概念两种方法分野:浅层裸提示 vs 深层方法——"提出正确的问题 + 强制模型深入软件内部"(Hamid 昨日推文主题:如何找到模型中的深层 bug)
46:42关键步骤深层方法第一步:面对软件栈,常规做法是裸提示找关键漏洞/命令注入;Hamid 的做法完全不同
47:06关键步骤核心操作:让模型先为目标所用协议/堆栈/客户端编写一个兼容的协议客户端或协议解析器——完全不问任何安全问题——验证它真的有效
47:29重点结论然后才说"好了,现在去找漏洞吧"——这样做与随意尝试得到完全不同的结果
47:51关键案例戴尔显示器案例起点:生日礼物 Stream Deck 空按钮多、插件不够用 → 有线连接多台显示器/系统想轻松切换、不想用戴尔糟糕的画中画/KVM 软件
48:32关键案例中期成果:实现了部分连戴尔标准软件都没有的功能(未公开的固件功能);过程中发现它调出并反转了通过 USB/DisplayPort 控制显示器的协议
48:54关键案例深入:想改显示器固件 → 遇到硬件层完整性保护与认证 → 研究绕过方法("剩下的你能想象了")
49:36重点结论案例结论:直接让模型找戴尔显示器漏洞不太可能发现这些洞——因为一开始就没做好、没问对问题、没建立发现深洞必需的背景;不重复上千次迭代,模型不会朝那个方向发展
详细内容

"还需要学编程吗":Hamid 明确否定"任何人都能成为黑客/安全专家"的说法:如果你没有 20 年经验、没用人工方式解决过这些难题,你就不知道该问什么问题、不知道该问什么正确的问题、不知道该查看组件/软件/架构/威胁模型的哪个正确部分。"这就是人为因素所在,是人类依然能够大放异彩和脱颖而出的地方。"

老手直觉 vs 裸提示:

  • 老手:看到软件或听人描述产品,即使不看代码、不实际操作,脑中立刻浮现该实现中最可能藏漏洞的五个关键组件、开发人员偷懒的地方、可挖解析器漏洞的位置。
  • 裸提示("找出你认为关键/有趣的漏洞"):或许能找到一些东西、或许有好东西甚至 RCE,但大部分不是深度漏洞,而且都是其他人已经找到过的。

深层方法论(先建上下文,再挖洞):

  1. 拿到软件栈后,不让模型直接找洞。
  2. 让模型为被测目标所用的任何协议/堆栈/客户端编写一个兼容的代理软件协议客户端或协议解析器——此阶段完全不问任何安全问题。
  3. 验证该客户端/解析器真的有效。
  4. 完成之后才下令:"现在去找漏洞吧。"
  • 效果:与随意尝试得到完全不同的结果——深洞来自先建立的协议级上下文。

戴尔显示器案例(方法论全程演示):

  • 起点(生活需求):姐姐姐夫送 Stream Deck 作生日礼物,空按钮太多想填满 → 插件不够用陷入死胡同;又因有线连接多台显示器与系统,想轻松切换且不想用戴尔官方的糟糕软件(画中画、KVM 等)。
  • 中期:不仅实现了想要的功能,有些功能连戴尔标准软件都没有——是未公开的固件功能;过程中注意到它调出并反转了通过 USB/DisplayPort 控制显示器的协议。
  • 深入:既然协议已明,想修改显示器固件 → 遇到硬件层完整性保护与认证 → 研究"有没有办法绕过?"→ 有——"剩下的你就能想象了。"
  • 结论:如果一开始就把显示器扔给模型"找漏洞",它不太可能找到这些洞——因为没在一开始问对问题、没建立发现这些好 bug 必需的背景信息;除非重复上千次迭代,模型不会自行朝那个方向发展。
09

约束的艺术、身份二元性与愿望清单

49:57 - 56:59

收束全片。首尾呼应"给模型更多自由、不加特别指导,它们反而更聪明",同时指出资格足以质疑评估结果时,人实际在引导结果走向。两个实战片段:域名原地流式替换+金丝雀的越界检测;模型在 mailto 上浪费大量时间、人凭风险等级判断"别掉进兔子洞"。被问到是否怕被取代时,同侪直言"我很享受不会被取代的感觉,但我质疑它"——模型迭代速度(unhinged 与 distilled 并存,一个小调整就开辟新应用领域)令人无法全部跟上。Hamid 的愿望清单:开放模型真正赶上前沿模型、实现民主化(已在 MacBook 跑 GLM 5/5.3 量化版),并拆除不合理护栏——限制注定不持久,不如为未来做好计划。

关键时间节点
时间类型说明
50:13重点结论回归基本问题:如何看待模型取代我们的工作/让工作更易或更难/人类是否成为绝对必要——"这些小细节与出人意料的小因素仍然至关重要"
50:39重点结论首尾呼应:给模型更多自由、不特别指导→它们更聪明;评估(evals)是对代理的吹毛求疵,更有资格质疑评估结果的人实际在引导结果走向
51:01核心概念构建上下文窗口做良性的事情=理解事物全貌,如同探索模糊测试树(fuzzing tree)——掌握协议之后,"这就像完美的攻击点"
51:22关键案例域名原地流式替换实验:规定无论发生什么都不能离开作用域;任何经间接提示注入等方式漂移出的域名都会被替换为作用域内内容或金丝雀(canary)——从而知道模型何时偏航
51:45关键案例mailto 教训:模型在 HTTP 场景花大量时间死磕 mailto(原音 mail 2)——但 mailto 在浏览器中需点击才打开网页/邮件客户端,不会间接弹出,影响极低
52:06重点结论人的判断价值:理解某事物的实际利用风险等级,才能对模型说"别掉进这个兔子洞,别在那儿待太久,别理会它,我们改做这个"
52:28关键案例同思路应用:Coug 在老式大型打印机上成功实现 PDF 打印——为解决一个已无人维护的问题而构建新方案
53:10核心概念身份二元性:"以前可以炫耀身怀绝技,现在模型样样精通"——不愿只做模型产出的傀儡;被迫在某些方面质疑、另一些方面信任过程
53:32警示直面焦虑:"我很享受不会被取代的感觉,但我质疑它"——目睹 Atlas、Fable(原音辨识存疑)等的规模与速度、unhinged 与 distilled 模型并存、一个小调整就开辟全新应用领域,几乎不可能全部跟上
54:18核心概念愿望清单第一项:开放模型(open models)真正赶上前沿模型、更易获取——强大模型的民主化才能帮助所有人
54:38警示批评封闭策略:把强大模型放在可信访问列表/特殊程序之后(仅特定客户/公司可用)是"非常短期的策略,不会长久"
54:59关键案例例证:6 个月前 Mythos(原音)被大量炒作,如今人人都能在地下室运行、很快也能跑在 MacBook 上
55:19关键案例Hamid 亲测:正在 MacBook 上运行 GLM 5 / GLM 5.3 的量化版本——"我们还没到目标,但已非常接近,按当前速度很快会实现"
55:42重点结论愿望清单第二项:拆除愚蠢/不合理的护栏;人们应接受"模型会做这些事"的事实——无论限制模型、限制人员还是限制硬件/模型访问,这种事都会发生
56:23背景信息预告:Builders & Breakers 活动(每年至少两次),把一群聪明人聚在一起进行坦诚真实的对话
56:45重点结论播客宗旨收束:"如果有人在你之前走过这条路,沿着这条路走总是更容易的"——祝你一切顺利,保重
详细内容

首尾呼应的自由与资格:给模型更多自由、不做特别指导,它们反而更聪明(呼应 15:52 的"放松结构");而评估(evals)本质上是对代理的吹毛求疵——当你有资格质疑评估结果时,你实际在引导结果走向(呼应医疗研究的提问资格)。

上下文即攻击点:构建上下文窗口做良性的事情意味着理解事物全貌——如同探索模糊测试树(fuzzing tree):所有可行选择都在眼前、协议已看过且掌握——"某种意义上这就是完美的攻击点"。

约束与止损的实战:

  • 域名原地流式替换:规定无论发生什么都不许离开作用域;任何通过间接提示注入等方式漂移出的域都会被替换为作用域内内容或一个金丝雀(canary)——据此可知模型何时偏航。
  • mailto 止损:模型在 HTTP 场景花了"海量时间"死磕 mailto——但 mailto 需在浏览器中点击、再打开网页或邮件客户端,不会间接弹出,可利用性极低。理解实际风险等级后,人才有资格说"别掉进这个兔子洞,别待太久,别理会它,改做这个"。
  • 同侪案例:Coug 用同样思路在老式大型打印机上实现了 PDF 打印——为解决一个官方已放弃的问题而构建新框架。

身份二元性:以前可以靠"身怀绝技"炫耀,现在模型拥有各种高超技能——"我不想成为它产出的傀儡";它既迫使我质疑事物,又迫使我在另一些方面信任过程。"我很享受不会被取代的感觉,但我对此表示质疑"——目睹 Atlas、Fable(原音辨识存疑)等项目的规模与速度、能力越来越强,unhinged(放飞)与 distilled(蒸馏精简)模型并存、周围发生的事多到几乎不可能全部跟上;对模型的一个小小调整就能开辟全新的应用领域。

愿望清单(对 Hamid 的最终提问):

  1. 开放模型真正赶上前沿模型、变得更加易获取——强大模型的民主化将帮助所有人。把强大模型锁在可信访问列表或特殊程序后(只有特定客户/公司被信任)是短期策略、"不会长久":正如 6 个月前被疯狂炒作的 Mythos(原音),现在人人都能在自家地下室运行,很快也能跑在 MacBook 上。Hamid 本人正在 MacBook 上跑 GLM 5 / GLM 5.3 的量化版——"我们还没到,但已接近,按当前速度很快实现"。
  2. 拆除愚蠢/不合理的护栏:并非所有护栏都愚蠢,但不合理者应消失。人们应逐渐接受"模型会做这些事"的事实——无论怎么限制模型、限制人员、限制硬件或模型访问,这种事都会发生。"与其把精力浪费在限制一些你知道不会持久的东西上,不如为未来做好计划。"

收官:感谢嘉宾;这是 Builders & Breakers 播客首播。节目组每年至少举办两次 Builders & Breakers 线下活动,把一群非常聪明的人聚在一起进行坦诚而真实的对话——为那些以惊人速度建造与拆除的人们提供高速捷径,"因为如果有人在你之前走过这条路,沿着这条路走总是更容易的"。

整体总结

这期播客本质上回答了一个问题:当所有人都用着相同的模型时,安全研究的竞争力从哪里来? Hamid Kashfi 的答案是"20% 模型 + 80% harness"——差异藏在工程与人的经验里。

三条主线贯穿全场:

  1. 工程线:Hackbot 的工厂化拆解(侦察→利用)揭示了工具链的重构压力。最具颠覆性的发现是对最新模型"强制工具清单与步骤反而降低产出"——这意味着 harness 必须随模型代际持续重写,两年不重构就会被无声淘汰(误判为"自己技能退步")。同时,模型本质非确定(同题百跑得 99 种结果),规模化交付必须在框架设计、结果监控、轨迹审计上补课——在家做研究与企业交付是完全不同的两个世界(成本、合规、审计黑洞、子代理撞护栏)。
  2. 行业线:漏洞不会枯竭——LLM 生成代码 60-70% 含缺陷(Code White 白皮书)且比例永不归零、动态代码每次变更按固定概率引入新漏洞、模型开始发现新漏洞类型。行业身份从"破坏者/渗透测试员/英雄"整体转向"建设者",这是 1-3 年的黄金窗口期,"我们都是十倍黑客",但窗口会随市场饱和关闭。
  3. 人的线:人为因素不可替代,且价值发生了迁移——从"亲手挖洞"迁移到"提问资格"(医生用专业术语提问使诊断提升 70% 的类比)与"建立上下文"(先让模型写协议客户端/解析器、验证有效,再下令找漏洞——戴尔显示器案例全程演示)。人负责判断风险等级(mailto 兔子洞止损)、注入多年经验("因为模型不知道该问什么")、以及设计约束与金丝雀检测漂移。最终愿望指向开放模型民主化(MacBook 跑 GLM 5 量化版已是现实)与拆除不合理的护栏——"与其限制注定不持久的东西,不如为未来做好计划。"

一句话总结:模型接管了繁重工作,但"问对问题、建对上下文、搭对 harness"仍然——并且在可见的未来持续——属于人。