summaryrefslogtreecommitdiff
path: root/docs
diff options
context:
space:
mode:
authorYuren Hao <yurenh2@illinois.edu>2026-07-31 04:40:51 -0500
committerYuren Hao <yurenh2@illinois.edu>2026-07-31 04:40:51 -0500
commit15abb3ee664955bf9bb93c46825a4ad8947998fd (patch)
tree293f8d7870ce74def6cebd044f60e062d7aee1aa /docs
parentbde5a676779cce353817f68c9dcbe0c90d28dd1c (diff)
Dillavou通话材料v3: 机制段按RESULT 77-79改判(读出地板+零成本修复+小尺寸EP胜BP), Q2改为板上对比读出/physical epsilon, cheat sheet加破案更新节
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_014FAPDWQ49M5Ye3NpTndTpn
Diffstat (limited to 'docs')
-rw-r--r--docs/hardware/CALL_CHEATSHEET_DILLAVOU_CN.md144
-rw-r--r--docs/hardware/CALL_SHEET_DILLAVOU.pdfbin0 -> 26781 bytes
-rw-r--r--docs/hardware/CALL_SHEET_DILLAVOU.tex82
-rw-r--r--docs/hardware/CALL_SHEET_DILLAVOU_final.pdfbin0 -> 32233 bytes
-rw-r--r--docs/hardware/DILLAVOU_CRASH_BRIEF_CN.md63
5 files changed, 289 insertions, 0 deletions
diff --git a/docs/hardware/CALL_CHEATSHEET_DILLAVOU_CN.md b/docs/hardware/CALL_CHEATSHEET_DILLAVOU_CN.md
new file mode 100644
index 0000000..f839f18
--- /dev/null
+++ b/docs/hardware/CALL_CHEATSHEET_DILLAVOU_CN.md
@@ -0,0 +1,144 @@
+# Dillavou 通话 cheat sheet v2(内部,自包含版——所有黑话展开)
+明早 11:00 ET = 你 10:00 CT。30 分钟:3 分钟更新 → 15 分钟四项测量 → 7 分钟合作形态 → 5 分钟下一步。
+他的背景速览在另一份 DILLAVOU_CRASH_BRIEF_CN.md;本文件管**我们自己这边**的每一个名词和数字。
+
+---
+
+## 第零部分:我们项目的一句话
+用 Equilibrium Propagation(EP)从零训练**标准 transformer 语言模型**:推理就是普通前向,EP 只存在于训练环节;所有设计选择都刻意保持模拟电路可实现。已训到 72M(定案)和 135M(跑通,有新现象)。
+
+## 第一部分:我们的名词表(每条 = 是什么 + 数字 + 对 Sam 怎么说)
+
+### 训练算法本体(cascade-EP)
+- **free phase**:普通前向传播,逐层算出每层输出 o_l,状态 z_l = o_l。就是推理。
+- **nudged phase**:在**输出端**注入一个正比于损失导数的"力" d(幅度由 β 控制),这个力经反向通路逐层传下去,然后各层前向重建 z = o + d,共 K=3 轮。
+- **θ-读出(权重更新)**:每层本地对比 nudged 状态和自己的输出,⟨d, ∂o/∂θ⟩ 型的局部乘积——**没有任何一层的参数用反向传播更新**。
+- 对 Sam 的话术:**"two relaxations and a local contrast read per weight——和你的 CLLN 同一族,只是我们的'网络'是 transformer,'弛豫'是逐层重建。"**
+
+### β / nudge 幅度 / 走廊(corridor)
+- **β** = nudge 幅度,名义值 3e-3。
+- **走廊** = 合法 β 区间。**上界**:β 太大 → 弛豫回路增益超 1 → 状态发散(我们的判据:弛豫残差 res > 0.02 就算越界)。**下界**:曾假设有信噪比软下界(β 越大越好),控制变量实验证明**域内 CE 平坦**——下界假设已废。
+- **上界随训练下沉**:输出矩阵最大奇异值 σ 从 ~242 涨到 ~473,上界大致 ∝1/σ²——训练把模型"磨尖",能承受的 nudge 变小。
+- 对 Sam:**"nudge 的可用窗口不是常数,随训练下沉——这就是 call sheet 测量 2 要在物理上复现的'窗口漂移'。"**
+
+### bsign(随机符号 nudge)⭐我们的稳定性王牌
+- 每个 batch 掷硬币决定这次 nudge 用 +β 还是 −β。
+- 为什么有用:单侧 nudge 有 O(β) 系统偏差(测得约为梯度范数的 0.3–1%);符号翻转时偏差跟着翻号 → 期望中抵消。成本不变(仍只有一次 nudged phase)。
+- 战绩:72M 两颗 seed、135M 全程,**零失稳事件完赛**。
+- 硬件翻译:一个极性开关 + 每 batch 一个无偏随机位(噪声比较器即可)。
+- ⚠️ **别和 Dillavou 的 sign-only 混淆**:bsign 是"nudge 的符号随机";他 2022 板的 sign-only 是"更新量只取符号(±固定步长)"。两码事。同板对比里 bsign 可以是 sign 家族的第三臂。
+
+### centered(对称 nudge)
+- ±β 各做一次 nudged phase 取平均,偏差消得更干净,但成本 1.67×。我们主线不用它(bsign 以 1× 成本拿到大部分好处)。
+
+### 72M 定案数字("封卷" = 多 seed 双臂对照的最终结论)
+- EP(bsign,2 seeds 平均)final CE **3.3637** vs BP twin(3 seeds)**3.2882 ± 0.006**。
+- **诚实 gap = +0.076 nats ≈ 8% perplexity**。
+- 用 centered 估计器(1 seed)gap = **+0.044 ≈ 4.5% ppl**(成本 1.67×)。
+- ⚠️ 口径纪律:**+0.076↔8%,+0.044↔4.5%,别把 0.076 说成 4-5%**(call sheet 已修正)。
+- twin 纪律:同架构、同 tokenizer、同数据顺序、同优化器(Muon 混合)、同步数、同评测。
+- 若他提我们七月邮件里"0.05 nats 后来证明是噪声":那是 42M、4k 步、3 seed 下统计不可分;到 72M 全程的定案就是上面这组诚实数字——我们主动报,不回避。
+
+### ⚠️ 破案更新(07-30 深夜,覆盖下面两节的机制解释)
+下面"泄漏"和"dgain"两节记录的机制(顶层非线性硬开关、需要大位移)**已被推翻**。真因 = **模拟器读出的
+单精度舍入**:宽度变大 → 激活 RMS 变大 → 推动量 d 相对于激活小于单精度机器精度(1.2e-7)→ 在
+z = o + d 里被舍入抹掉,而读出又靠 (z−o) 把它减回来 → 亚精度分量永久丢失。
+- 三重证伪全中:双精度下泄漏完全消失;β/8 按预测更多层转病;β×8 按预测痊愈。
+- 修复 `--read_lin` 一行、零成本:读出改用内存里满精度的 d 张量本身(−⟨d,o⟩,代数恒等),不做大数相减。
+ 单精度下逐块读数 == 双精度;CE 级仪器上泄漏 0.0462 **关闭 100%**(尾窗 3.5206 = all-BP 杆,预测精确命中)。
+- 连锁:dgain/×128/逐层几何 profile 全套退役(那是绕 bug 的补丁);小尺寸阶梯上 EP 本来就赢 BP
+ (C192 两 seed 皆胜,C320 打平),"越宽越差"正是这个 bug 的指纹。
+- **对 Sam 的讲法**(他会喜欢):这就是差分读出(differential readout / correlated double sampling)
+ 的软件版——要测小差值必须直接测差值本身,不能拿两个大数相减。板上对应问题 = 你的更新单元怎么读对比
+ 量、物理上的最小可分辨对比量(physical epsilon)由什么决定(= 修订版 call sheet 的 Q2)。
+- 保留下面两节只为背景("我们曾经以为是物理"),**别在通话里当现行结论讲**。
+
+### 135M / C768 泄漏(the leak)⭐已破案,见上方更新
+- 现象:把 72M 的配方**原封不动**(冻结配方)搬到 135M(宽度 512→768),EP 出现**恒定速率**的相对落后:每 6k 步落后 ~0.046 CE。
+- 定位(BP 替换实验):把**上半 6 层**的 EP 梯度换成真 BP 梯度 → 落后 100% 消失;换**下半 6 层** → 0% 消失。attn 贡献约 2/3。
+- 免疫谱:换 centered、K=3→8、fp32、bsign、动 head 学习率——全都治不了;泄漏大小 ∝ 1/β。
+- 机制白话:上层的非线性随训练变成"硬开关",小 nudge 推不动它们 → EP 的测量**系统性遗漏**这部分响应;这是一致性偏差(每步都朝同一个方向错),会累积。
+- 对 Sam 的桥:**"这就是你 2505.22887 里'不受控学习偏差持续改写表征'的 transformer 版——同一类病,我们在 LM 尺度上做了定位和剂量学。"**
+
+### dgain(位移放大 = 泄漏的治疗)
+- 做法:只在**状态形成**时放大力的效果(z = o + G·d,上半层 G 最高到 128),但读出用的对比参考仍是真 d → 对线性响应一阶无操作,只把"硬开关"推过阈值。
+- 剂量曲线(6k 步筛查仪器上):×4→收回34%,×8→50%,×16→63%,×32→75%,×64→92%,**×128→97%**(对数律)。
+- 全程验证(190k 步):尾窗口径只收回 **63%**(两个候选解释在裁:治疗从中途才开始 vs 剂量需求随训练漂移);但 **×128 位移全程零失稳**。
+- 硬件翻译(= call sheet Q2 的来历):**上层的 nudge 注入增益可能要比下层大 1–2 个数量级**——OTA 注入是否吃得下两个 decade 的可编程增益,是要他判断的板级问题。
+- 正在跑的"谱仪":逐层测"泄漏 vs nudge 增益"曲线(和真 BP 梯度配对差分),直接产出**每层需要多大 nudge**的规格表;跨 5 个模型宽度重复以拟合标度律。他问最新进展就说这个。
+
+### 筛查仪器(leak instrument)
+- "仪器"= 从同一个训练快照出发,跑成对的 6k 步短训练段、比较尾段验证损失。90 分钟测一个候选配方。上面的剂量曲线全是它出的。
+
+### 梯度保真遥测(cos 0.99 / 0.97 的出处)
+- 训练中每 1000 步,把 EP 更新和真 BP 梯度算余弦相似度:健康配方全程 ~**0.99**。
+- 故障注入实验:1% 前向噪声、10% 误差通道噪声、器件失配下 ~**0.97**,且追踪的是**带故障网络本身**的梯度,不是理想网络的 → "the rule co-adapts to the device"(规则与器件共适应)的实测含义。
+- ⚠️ 内部注意:dgain 高增益下逐步余弦会掉到 0.25–0.3 而结果反而更好(一致偏差换成了随机误差,随步数平均掉)——所以我们已把"逐步方向指标"退役,以结局(CE,配对对照)为准。他若深问保真度就这么答。
+
+### 容忍度账本(fault ledger,七月 brief 里的表)
+| 故障 | 免费 | 边缘 | 死 |
+|---|---|---|---|
+| 权重精度 | 8-bit(ΔCE +0.004) | 6-bit(+0.05) | 4-bit |
+| 前向状态噪声 | 1% | — | — |
+| 误差通道(nudge)噪声 | 10% 相对 | 30% | — |
+| 除法器失配 / 门增益 / 相位 | 3% / 10% / 0.03 rad | 10% / — / 0.1 rad | — |
+- 唯一硬规格:**约 7-bit 有效权重**。8-bit 量化下 EP 相对同样量化的 BP **无额外损失**(quantization parity)。
+
+### 振幅扫描(r-sweep)⭐"大 nudge 免费"论点(call sheet 测量 2 的锚点)
+- 把 nudge 幅度扫 20×(r = 0.02→0.4),梯度余弦**平坦不变** → 误差通道是**乘性**的(信号和误差一起缩放)。
+- 推论:真正定下限的是**加性**读出噪声(放大 nudge 可以碾过它)→ 模拟硬件可以用大 nudge 换读出精度。
+- 要问他的(Q3):bench 上分离加性/乘性的正确协议是什么。
+
+### 成本口径(三个数字,别混)
+- 对外统一:**~2× BP 墙钟**(保守口径,项目页同款)。
+- 若被问细:7 月 brief 的 3.2× 是旧配方 FLOPs 口径;现配方实测墙钟 1.4–2×。
+- 结构优势口径:我们 1 个 nudged phase × K=3 弛豫;视觉 EP 最大先例(KHS,VGG10 63M,ImageNet)是 2 phase × 10 迭代,付 6.7×(单侧)到 12×(对称)墙钟。
+
+### 硬件线名词
+- **$300 MVP / 硬件梯子**:rung 1 = 单边计量瓦片($70–130):一条 MOSFET 边、共享权重电容、精确差方对比通道 + sign-only 更新单元、OTA 电流 nudge,学习环路里无处理器/转换器/时钟。rung 2 = 8 边孪生网络($170–300):非线性回归 + EP-vs-CL 同板 + exact-vs-sign + bias-vs-nudge 曲线。rung 3 = 32 边($450–900)。
+- **OTA 电流 nudge**:跨导放大器把损失导数作为**电流**注入输出节点 = EP 的"力";他的板子用**电压钳**(CL 的"约束")。McGinnis-Li-Mori 刚证明:小 nudge 极限下 EP 是精确梯度流,CL 多一个三次修正项 → 同板对比是在**验一条定理**。
+- **MDAC(乘法 DAC,AD7528)**:SPICE 单列模型用的分立乘法器件——"能真买到零件"级别的设计。
+- **能量投影**:SPICE 实测模拟核 + 数据手册外围 = **0.21–0.63 pJ/MAC**,对照数字 INT8 系统包络 0.3–1 pJ/MAC。
+
+---
+
+## 第二部分:通话流程
+
+### 开场 3 分钟(四句话,07-31 更新版)
+1. 72M 定案(旧口径):EP 3.364 vs BP 3.288,gap +0.076 nats(≈8% ppl);两 seed 零失稳。**注**:这是
+ 带着下面那个数值 bug 训出来的,修复版重训在跑,真数字预计更好——主动这么说,别把旧数字讲成终局。
+2. 前天晚上破案:所谓"宽度依赖的估计器损耗"是**模拟器读出的单精度舍入伪影**,不是 EP 的性质。修复一行、
+ 零成本,标准测试上关闭 100%(双精度对照 + 预注册的幅度平移测试双重验证)。
+3. 修复后的小尺寸阶梯:EP 打平或**赢过**同配置 BP(每臂 2 seed)。"越宽越差"是 bug 的指纹。
+4. 因为算法层仍在演化,硬件问题重构为四项**配方无关**的原语测量(call sheet 的表);今天要你对清单的
+ 判断,板子不在今天 commit。
+
+### 四项测量(call sheet 正文,逐条要他判断)
+1. 对比更新保真度(exact 差方通道)——sim 锚点 cos 0.97 co-adaptation;物理上同律吗?
+2. nudge 窗口 + 加性地板——sim 锚点:窗口随训练下沉 ~1/σ²;乘性主导(20× 平坦);物理地板怎么测?
+3. sign-only vs exact vs 随机符号(bsign)三臂——他 2022 的 sign 谱系 + 我们的 bsign 战绩。
+4. EP 电流 nudge vs CL 电压钳同板——McGinnis-Li-Mori 定理的实验验证。
+
+### 五个点名问题(call sheet 尾部)
+Q1 清单增删? Q2 上层 nudge 增益 2 个 decade,OTA 吃得下吗? Q3 加性/乘性分离的 bench 协议? Q4 他的板子上"弛豫没 settle"的观测量是什么、gate 过更新吗(我们 sim 里 res 残差预测了每一次爆炸)? Q5 孪生副本 vs 时分复用单网络,8–32 边规模下怎么选?
+
+## 第三部分:他可能问的 → 答案
+- **"gap 到底多大,会不会又缩水"** → 主动给全口径:72M 上 bsign +0.076/8%,centered +0.044/4.5%(1.67× 成本);135M 冻结配方下 gap 变大、已定位已有治疗。我们的纪律是 best/final/尾窗三口径都报。
+- **"成本多少"** → ~2× 墙钟(保守);结构上 1 phase×3 弛豫 vs KHS 的 2×10。
+- **"为什么信 sign 类方法"** → 他自己 2022 年就证明 sign-only 能学;我们 bsign 在 72M/135M 的零失稳是 LM 尺度的续证;exact 通道做参考臂。
+- **"你们的 transformer 弛豫和我的电阻网络弛豫是一回事吗"** → 家族相同(两次弛豫+本地对比),拓扑不同:我们是层级级联(前馈重建),他是无向电阻网络到能量最低点。诚实说这是"同一学习规则、不同物理",正是为什么原语测量比配方测量有价值。
+- **"ARIA 项目/你们和工业界"** → 先问他的 scope;我们这边:在和工业界谈算力(不点名 Rain 细节),学术测量线开放发表。
+- **"131 团队里谁做硬件"** → 现状诚实:SPICE/设计我们自己做到了单列水平,缺 bench 经验——正是来找他的原因;他现在独立身份,若有兴趣可以是伙伴而不只是顾问。
+
+## 第四部分:不承诺清单
+板子不当场 commit;不排他;不给日期承诺(七月 brief 的 "six-week plan" 若被引用 → "等测量清单定稿后排期");**不做任何 IP 承诺**(他是 pre-spinout 个人,IP 敏感度高);不替 Alexi/教授们答应署名。
+
+## 第五部分:他的现状(ARIA)
+- 2025-05 离开 Penn,英国 ARIA(DARPA 仿制品)"R&D Creator":**国家直接资助个人**做 "Learning Metamaterials"(CLLN 线延续),self-employed,IP 归个人,创业是默认出口。相关 programme(Scaling Compute ~£50M)论题 = AI 算力降 1000×。
+- 含义:①模拟学习硬件是他的全职使命,ARIA 叙事缺算法侧证据,我们是那块拼图;②七月 brief 的 ask(bench access/学生)作废——他没实验室了,新 ask = 设计判断 + 他本人作硬件侧伙伴的可能性;③IP 敏感度上调,开放发表立场讲清楚即可。
+- 背景彩蛋:物理 PhD 前在 Deloitte 做过两年咨询——商业话术无障碍。
+
+## 第六部分:后勤
+- 确认信带 Zoom 链接(你发,用他 Gmail: sam.dillavou@gmail.com)。
+- 开会前 ~1h 发修正版 call sheet PDF,一句话:"Attached a one page update so the call is aimed."
+- 谱仪/ladder 若在通话前出数,我会把"逐层 nudge 需求曲线"的第一版发你——现场可以口头提。
diff --git a/docs/hardware/CALL_SHEET_DILLAVOU.pdf b/docs/hardware/CALL_SHEET_DILLAVOU.pdf
new file mode 100644
index 0000000..0c14175
--- /dev/null
+++ b/docs/hardware/CALL_SHEET_DILLAVOU.pdf
Binary files differ
diff --git a/docs/hardware/CALL_SHEET_DILLAVOU.tex b/docs/hardware/CALL_SHEET_DILLAVOU.tex
new file mode 100644
index 0000000..5bb9ce9
--- /dev/null
+++ b/docs/hardware/CALL_SHEET_DILLAVOU.tex
@@ -0,0 +1,82 @@
+\documentclass[10pt]{article}
+\usepackage[letterpaper,margin=0.72in,top=0.6in,bottom=0.6in]{geometry}
+\usepackage[T1]{fontenc}
+\usepackage{newpxtext,newpxmath}
+\usepackage{booktabs,array,enumitem,xcolor,titlesec}
+\definecolor{accent}{RGB}{138,31,31}
+\titleformat{\section}{\normalsize\bfseries\color{accent}}{}{0pt}{}
+\titlespacing{\section}{0pt}{9pt}{4pt}
+\setlist[enumerate]{leftmargin=1.2em,itemsep=1.5pt,topsep=2pt,parsep=0pt}
+\setlist[itemize]{leftmargin=1.1em,itemsep=1.5pt,topsep=2pt,parsep=0pt}
+\pagestyle{empty}
+\setlength{\parindent}{0pt}
+\setlength{\parskip}{3pt}
+\begin{document}
+
+{\large\bfseries EP transformer program $\rightarrow$ analog board: call sheet}\\
+{\small supplements the July 12 brief and build plan \,\textperiodcentered\, Yuren Hao (UIUC) \,\textperiodcentered\, August 2026}
+
+\section{Program state since the July brief (measured)}
+\begin{itemize}
+\item \textbf{72M-parameter transformer LM sealed:} EP final CE 3.364 (2 seeds) vs.\ a tuned
+backprop twin at 3.288 (3 seeds, $\pm$0.006); gap $+$0.076 nats ($\approx$8\% perplexity). The
+symmetric two-phase estimator narrows this to $+$0.044 ($\approx$4.5\%) at 1.67$\times$ cost. Zero
+instability events in both EP seeds. To our knowledge the largest LM trained with no
+backpropagation anywhere in the loop.
+\item \textbf{135M trained end to end} (2.7B tokens), also with zero instability events. It surfaced
+a width-dependent estimator loss localized to the upper layers --- which a per-layer probe has since
+traced to the simulator's own \emph{readout floor}: at larger widths the nudge displacement falls
+below single-precision machine epsilon relative to the activations and is rounded away in the
+contrast read.
+\item \textbf{The fix is free, and it is the software version of differential readout:} read the
+contrast from the stored displacement itself, never as the difference of two large signals. Verified
+against a double-precision control and a pre-registered amplitude-shift test; the loss closes 100\%
+at zero cost. At the smaller rungs of our scaling ladder, EP now matches or beats the matched
+backprop twin (2 seeds per arm).
+\item \textbf{Random-sign nudging} (nudge polarity flipped randomly per batch) is the stability
+winner at both scales: it removes the systematic single-sided bias at zero extra cost. On a board it
+is a polarity switch.
+\end{itemize}
+
+\section{The four primitive measurements (recipe-independent)}
+\begin{small}
+\begin{tabular}{@{}p{0.28\textwidth}p{0.40\textwidth}p{0.24\textwidth}@{}}
+\toprule
+\textbf{measurement} & \textbf{simulation anchor (measured)} & \textbf{board question}\\
+\midrule
+1. contrast-update fidelity (exact difference-of-squares channel) & update tracks the \emph{faulted}
+network at cos $\approx$ 0.97 under 8-bit weights, 1\% forward noise, 10\% nudge noise & does the
+same co-adaptation law hold in physics\\[2pt]
+2. nudge operating window and its floor & ceiling tracks loop gain and sinks over training
+($\sim 1/\sigma^2$ of the output map); error channel is amplitude-indifferent across $20\times$
+(multiplicative), so the floor is set by \emph{additive} readout noise & measure the physical floor;
+track window drift over training\\[2pt]
+3. sign-only vs.\ exact vs.\ random-sign updates & sign works; random sign removes the bias at
+scale; exact channel is the reference & continuous three-way comparison on one board\\[2pt]
+4. EP current nudge vs.\ CL voltage clamp & the distinction formalized by McGinnis, Li, and Mori &
+same board, same task, same metrology\\
+\bottomrule
+\end{tabular}
+\end{small}
+
+\section{Where we most want your judgment}
+\begin{enumerate}
+\item Is this the right primitive-level list? What would you add or cut, from your
+imperfection-characterization experience?
+\item \textbf{Reading the contrast:} our width-scaling loss was ultimately a readout-floor artifact,
+and the lesson is that the contrast must be measured differentially, never as a difference of two
+large signals. How do your update cells read the contrast, and what sets the smallest resolvable
+contrast (the physical epsilon) on the board?
+\item \textbf{Additive vs.\ multiplicative separation:} in simulation we sweep nudge amplitude at a
+fixed task. What is the right bench protocol for the same separation on the board?
+\item \textbf{Settling as a gate:} in simulation the relaxation residual predicts every blowup and
+gates the weight update. What settling observable did your boards expose, and did you gate on it?
+\item \textbf{Twin replicas vs.\ a time-multiplexed single network} at 8--32 edges: matching cost
+against memory cost, your call.
+\end{enumerate}
+
+\vspace{2pt}
+{\small We are not committing the board before this conversation; rungs 1--3 remain under \$1k in
+parts, funded on our side. Results are intended for open publication.}
+
+\end{document}
diff --git a/docs/hardware/CALL_SHEET_DILLAVOU_final.pdf b/docs/hardware/CALL_SHEET_DILLAVOU_final.pdf
new file mode 100644
index 0000000..5e3d356
--- /dev/null
+++ b/docs/hardware/CALL_SHEET_DILLAVOU_final.pdf
Binary files differ
diff --git a/docs/hardware/DILLAVOU_CRASH_BRIEF_CN.md b/docs/hardware/DILLAVOU_CRASH_BRIEF_CN.md
new file mode 100644
index 0000000..20c4103
--- /dev/null
+++ b/docs/hardware/DILLAVOU_CRASH_BRIEF_CN.md
@@ -0,0 +1,63 @@
+# Dillavou 速成简报(内部,通话前读,~15 分钟)
+
+## 他是谁(30 秒版)
+Harvard 物理 PhD(导师 Shmuel Rubinstein,做摩擦与无序材料记忆——**不是 ML 出身,是实验凝聚态物理学家**)→ UPenn 博后(Douglas Durian + Andrea Liu 组,物理学习实验线的动手人,每代板子都是他搭的)→ 2025-05 起离开 Penn:ARIA(英国 DARPA 仿制品)R&D Creator,self-employed 做 "Learning Metamaterials"——pre-spinout 配置(个人持 IP,创业为默认出口),详见 cheat sheet 追加节。
+
+## 平台名词(他们的自称,用对了显得懂)
+**CLLN = Contrastive Local Learning Network**。两个完全相同的网络副本(free / clamped 两种边界条件),每条边一个本地学习单元,比较两副本响应、自主更新权重。无处理器、无外部存储、无时钟同步要求。"twin networks" 就指这两副本。
+
+## 四篇必懂
+### 1. PRApplied 2022 — "Demonstration of Decentralized Physics-Driven Learning"
+Dillavou, Stern, Liu, Durian。第一代板子:**线性**可变电阻网络,16 边。
+- 权重 = 数字电位器档位;每边**比较器 + XOR 取对比信号的符号,±固定步长更新(sign-only)**。
+- 任务:allostery、线性回归、Iris 三分类(~95%)。损伤鲁棒(剪边继续学)。
+- 名言(他常引):"a laboratory network of only 500 edges will already outpace its in silico counterpart"。
+- 局限:线性网络只能学线性任务;数字电位器还不是真模拟存储。
+- 理论蓝本 = Stern et al. 2021 PRX 的 coupled learning(钳位式对比学习)。
+
+### 2. PNAS 2024 — "Machine learning without a processor" ⭐我们邮件里 "your processor-free network" 指的就是它
+Dillavou et al.。第二代:**晶体管非线性边,权重 = 电容上的电荷**(真模拟存储,连续时间自主更新)。
+- 学会 XOR、非线性回归(线性系统学不了的任务),无任何数字处理器。
+- 数字:**重训秒级,执行微秒级,每晶体管皮焦级耗散**,损伤鲁棒。
+- 发现类似 NN spectral bias 的误差模式排序:先均值、再斜率、再曲率。
+- 我们板子的四要素(twin 副本 / 共享权重电容 / 本地对比更新 / 无钟)全部承自这里。
+
+### 3. arXiv 2505.22887 (2025) — "Understanding and Embracing Imperfection in Physical Learning Networks" ⭐邮件里点名的 imperfection 论文
+Dillavou, Guzman, Liu, Durian。
+- 发现:元件/测量不完美 → **极限环、精度退化、旧任务遗忘**,理想系统里都不存在。
+- 机制(解析模型):**"不受控的学习偏差持续改写内部表征"**,类比生物脑 representational drift。
+- 解法:system-agnostic 训练法缓解,哲学是"拥抱不完美"而不是配数字孪生去校正。
+- **明天最大的共同语言**:我们 C768 泄漏 = 同一类病(一致性估计器偏差长程累积);我们的 bias-vs-nudge 曲线就是这类病的定量仪器;"the rule co-adapts to the device"(cos 0.97 追踪带故障网络)与他的哲学完全同频。
+
+### 4. arXiv 2606.15443 (2026-06-13) — "Coercivity and Local Convergence of Physical Learning in Linear Circuits"
+**McGinnis, Xinbo Li, Mori——你邮件里写的 "McGinnis, Li and Mori" 作者没记错**(Li = Xinbo Li)。
+- 内容:线性电路、小 nudge 极限下,EP / CL / AL(他们新提的 Adjoint Coupled Learning)的**首个局部收敛分析**。
+- 核心区分(= 你邮件说的 "recently formalized" 的那个):**EP 和 AL 在自然损失上做精确梯度下降;CL 的动力学多一个三次修正项**——"力 vs 约束"的数学化版本。
+- coercivity 秩条件(由网络关联结构决定)⟹ 损失指数衰减;反例 = kite 电路(对称性使 coercivity 常数在解流形上退化),但 Sard 定理证明这种退化非泛型。
+- 同日姊妹篇 2606.15444(Kline 替 Li):EP 与 CL 在连续时间小 nudge 极限**守恒一个质量型量**,约束训练动力学。
+- 注意:这是 **Penn 数学系的组(Yoichiro Mori)**,不是 Dillavou 组,但他必然熟。给了"同板对比 EP nudge vs CL clamp"一个可检验的理论预言:两者应差在三次阶。
+
+## 他最近在忙什么(寒暄与收尾弹药)
+- **2511.17825 (2025-11,他一作)**:"Analog Physical Systems Can Exhibit Double Descent"——标准训练出不了 double descent,**为元件非理想性修改过的训练协议才出**。他的现行主线 = 从"演示能学"转向**不完美物理系统的训练科学**,和我们 call sheet 议程完美对齐。
+- 2509.15842:Restricted Kirchhoff Machine(Guzman/Ciarella/Liu)——CLLN 做无监督 RBM 类比,二值化 MNIST 仿真 + 时间/功耗/能耗 scaling 对比 CPU/GPU。
+- 2512.03799:物理网络的任务记忆/遗忘("Remembrance of Tasks Past")。
+
+## 邮件逐句底细对照(你写过什么 → 事实 → 他追问怎么接)
+| 你邮件里的话 | 背后事实 | 追问时接法 |
+|---|---|---|
+| "two continuously-running replicas, shared weight capacitors" | PNAS 2024 架构:两副本同一条边共用一个存权重的电容,更新电流由本地对比驱动 | 我们保留这个拓扑,departure 只在 nudge 注入和对比通道 |
+| "OTA current nudge alongside the voltage clamp" | 他的板子输出用电压钳(CL 式);我们加跨导放大器把损失导数作为电流注入(EP 式力) | McGinnis-Li-Mori 预言两者差在三次阶——同板对比可以直接验这个预言 |
+| "difference-of-squares contrast channel vs sign-only cells" | 他 2022 板就是 sign-only(比较器+XOR);exact 通道 = 模拟乘法算平方差型对比量 | 我们 bsign(随机极性)在 72M/135M 的稳定性给 sign 家族背书,第三臂 |
+| "bias-versus-nudge curve ... additive precision floor" | 我们 sim:振幅扫 20× cos 不变(乘性主导),下限由加性读出噪声定;他 2505.22887 是同类病的电路侧记录 | 问他 bench 上怎么分离加性/乘性(call sheet Q3) |
+
+## 万一他往深处问
+- **kite 反例**:菱形+对角的对称小电路,对称性让收敛常数在解上退化——记住"非泛型,几乎所有目标输出下 coercivity 成立"即可。
+- **spectral bias 排序**:他 PNAS 板子先学均值再斜率再曲率——如果他提,接"我们 LM 侧也看到低频先收敛的对应物"。
+- **异步性**:他们 2022 还有篇 Desynchronous Learning(arXiv 2201.04626)——异步更新不坏收敛,clockless 的实验支撑。
+- 不懂就直说"这块我还没读透,会后补"。他是实验物理学家,**诚实比装懂值钱**。
+
+## 人设校准(最重要的一条)
+他不是 ML 理论家,是**搭板子的实验物理学家**。聊具体的观测量、测量协议、元件行为最对味;聊 transformer 内部机制他可能反过来问你基础问题——这是好事,主导权在你。他的哲学一以贯之:**别和物理对抗,让学习规则吸收物理**。我们整条线(co-adaptation、bsign、拥抱大 nudge)都顺着这个哲学讲。
+
+## 来源
+- arXiv:2108.00275 (PRApplied 2022) · arXiv:2311.00537 (PNAS 2024) · arXiv:2505.22887 (imperfection) · arXiv:2606.15443 + 2606.15444 (McGinnis 组两篇) · arXiv:2511.17825 (double descent) · arXiv:2509.15842 (Kirchhoff machine) · aps.org 个人页(博后身份,已过时)