<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Problems on 我的赛博存档</title><link>https://chenzhao.github.io/zh/categories/problems/</link><description>Recent content in Problems on 我的赛博存档</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 17 May 2026 00:00:00 +0800</lastBuildDate><atom:link href="https://chenzhao.github.io/zh/categories/problems/index.xml" rel="self" type="application/rss+xml"/><item><title>非典型题目: 恢复被打乱的神经网络层序</title><link>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</link><pubDate>Sun, 17 May 2026 00:00:00 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</guid><description>&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;p&gt;题目来源是 Jane Street: &lt;a href="https://huggingface.co/spaces/jane-street/droppedaneuralnet"&gt;https://huggingface.co/spaces/jane-street/droppedaneuralnet&lt;/a&gt; . 看到题目的第一反应是, 有数据有参数恢复一个 permutation, 这应该很简单吧? Jane Street 降智了? 正好拿来试试 AI 的能力.&lt;/p&gt;
&lt;h2 id="解题过程"&gt;解题过程&lt;/h2&gt;
&lt;p&gt;题目直接给 Codex (26 年春节后不久的某个版本) 它的方向完全不对, 说明这至少是一道全新的题目, 不 trivial.&lt;/p&gt;
&lt;p&gt;给了几个粗暴的 data driven 思路让 Codex 尝试, 比如用给的数据训练一些同样结构的网络再学层序和参数的相关性, 都有一些效果但很快卡住, 也不知道离正确答案差多远, 48 层的 permutation 刚好碰到 NP-hard 的强度, 题目还是有点水平的.&lt;/p&gt;
&lt;p&gt;重新仔细审题, 发现 residual 的线索: 后层 bias 不仅直接连到输出, 也互相通过 residual 连接, (一部分)梯度是稳定传递的. 按这个思路根据 bias 相似性排序,能得到很漂亮的图. 解决一半了.&lt;/p&gt;
&lt;p&gt;这时候大意了,又觉得题目简单, 又丢给 Codex data driven 学前后层的关联, 效果还是很差. 启动人脑思考, 回忆起读博时那些让人痛苦的近似算法, 至少要有一个 heuristic 方向, 突然醒悟 loss 就是现成的 heuristic. 然后又大意了, 让 Codex 按 loss 搜索, 弄出了一坨愚蠢而勤奋的 beam search. 无奈又启动人脑思考, 现在的问题是: 每次选一层, 中间步骤没有反馈, 全部选完可以得到结果. RL啊, 显然是 RL, 这还要人脑想么, AI 这都意识不到? 失望.&lt;/p&gt;</description></item></channel></rss>