<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Machine Learning on 我的赛博存档</title><link>https://chenzhao.github.io/zh/categories/machine-learning/</link><description>Recent content in Machine Learning on 我的赛博存档</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 17 May 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://chenzhao.github.io/zh/categories/machine-learning/index.xml" rel="self" type="application/rss+xml"/><item><title>非典型题目: 恢复被打乱的神经网络层序</title><link>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</link><pubDate>Sun, 17 May 2026 00:00:00 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</guid><description>&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;p&gt;题目来源是 Jane Street: &lt;a href="https://huggingface.co/spaces/jane-street/droppedaneuralnet"&gt;https://huggingface.co/spaces/jane-street/droppedaneuralnet&lt;/a&gt; . 看到题目的第一反应是, 有数据有参数恢复一个 permutation, 这应该很简单吧? Jane Street 降智了? 正好拿来试试 AI 的能力.&lt;/p&gt;
&lt;h2 id="解题过程"&gt;解题过程&lt;/h2&gt;
&lt;p&gt;题目直接给 Codex (26 年春节后不久的某个版本) 它的方向完全不对, 说明这至少是一道全新的题目, 不 trivial.&lt;/p&gt;
&lt;p&gt;给了几个粗暴的 data driven 思路让 Codex 尝试, 比如用给的数据训练一些同样结构的网络再学层序和参数的相关性, 都有一些效果但很快卡住, 也不知道离正确答案差多远, 48 层的 permutation 刚好碰到 NP-hard 的强度, 题目还是有点水平的.&lt;/p&gt;
&lt;p&gt;重新仔细审题, 发现 residual 的线索: 后层 bias 不仅直接连到输出, 也互相通过 residual 连接, (一部分)梯度是稳定传递的. 按这个思路根据 bias 相似性排序,能得到很漂亮的图. 解决一半了.&lt;/p&gt;
&lt;p&gt;这时候大意了,又觉得题目简单, 又丢给 Codex data driven 学前后层的关联, 效果还是很差. 启动人脑思考, 回忆起读博时那些让人痛苦的近似算法, 至少要有一个 heuristic 方向, 突然醒悟 loss 就是现成的 heuristic. 然后又大意了, 让 Codex 按 loss 搜索, 弄出了一坨愚蠢而勤奋的 beam search. 无奈又启动人脑思考, 现在的问题是: 每次选一层, 中间步骤没有反馈, 全部选完可以得到结果. RL啊, 显然是 RL, 这还要人脑想么, AI 这都意识不到? 失望.&lt;/p&gt;</description></item><item><title>机器学习中的错误数据</title><link>https://chenzhao.github.io/zh/articles/weak-supervision/</link><pubDate>Sun, 11 Jan 2026 00:35:08 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/weak-supervision/</guid><description>&lt;p&gt;尝试理清楚机器学习数据的错误是哪来的以及如何处理.&lt;/p&gt;
&lt;p&gt;监督学习可以在给定 $X Y$
的前提下 work 是很直观的, 选一个 hypothesis $X Y \sim P $
推断 P 的参数即可, 懂基本的统计概率知识就能理解. 然而有些工作 claim 没有准确的 Y 也能 work , 就没那么直观了.&lt;/p&gt;
&lt;p&gt;最简单的情况, 二分类器 h 在真实世界的表现叫 true risk/generalization error R(h) 是观察不到的, 但可以用有限 X Y 得到的empirical risk $\hat{R}(h)$ 去估计, 两者的差距叫做 generalization gap. PAC 理论在这里用 hoeffding 不等式 (简化形式)
$$P(\hat{\mu}-\mu \geq \epsilon ) \leq e^{-2n\epsilon^2}$$
给一个宽到除了推公式就没什么用的 bound:
$$ R(h) \leq \hat{R}(h) + \sqrt{\frac{\ln(2/\delta)}{2n}} , \delta= 2e^{-2n\epsilon^2}$$
不过至少证明了: 数据越多估计越准(废话&amp;hellip;), 具体影响是 $O(\frac{1}{\sqrt{n}})$&lt;/p&gt;</description></item></channel></rss>