<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>文章 on 我的赛博存档</title><link>https://chenzhao.github.io/zh/articles/</link><description>Recent content in 文章 on 我的赛博存档</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Wed, 15 Jul 2026 15:41:38 +0800</lastBuildDate><atom:link href="https://chenzhao.github.io/zh/articles/index.xml" rel="self" type="application/rss+xml"/><item><title>为什么 state 叫州?</title><link>https://chenzhao.github.io/zh/articles/administrative-division-terms/</link><pubDate>Wed, 15 Jul 2026 15:41:38 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/administrative-division-terms/</guid><description>&lt;p&gt;总觉得这个翻译不太准确, 稍微调研了一下, 先说结论: 就是不太准确. 历史原因, 日本人这么翻译对日语是准确的, 到中国就偏了(因为日语引入国和州的时候也有翻译偏差).&lt;/p&gt;
&lt;p&gt;国在春秋战国的时候是诸侯国的意思, 是地方政治实体(题外话, 当时整个实体其实叫邦, 国是国都所以也可以代表整个实体, 后来刘邦当了皇帝才统一改叫国, &lt;a href="https://zh.wikisource.org/zh-hans/%E5%8F%B2%E8%AB%B1%E8%88%89%E4%BE%8B/%E5%8D%B7%E4%B8%80"&gt;https://zh.wikisource.org/zh-hans/%E5%8F%B2%E8%AB%B1%E8%88%89%E4%BE%8B/%E5%8D%B7%E4%B8%80&lt;/a&gt; 诗经国风其实是邦风, 秦相国吕不韦是相邦吕不韦, 秦灭六国这种说法最早只能找到史记, 当时的人是如何自称的已经没法考证了). 这个用法一直延续到汉朝, 中央直接派官员统治的叫郡/县, 封给诸侯王的领地叫国. 日本历史上已经有 くに（kuni）这个概念, 大概也是诸侯的领地, 所以自然翻译成了国. 不过,所谓的令制国的国级官员是中央派遣的, 并不像汉代封的诸侯, 反而国下的郡是地方自治的. 所以从行政上来看, 这里的国更接近中国的州或者郡.&lt;/p&gt;
&lt;p&gt;州则本来是地理概念, 洲, 意思是水分割出的土地. 九州是按照大山大河为界把中原划分出来的九块(冷知识: 九州没有统一定义, 不同古籍讲具体是哪九州竟然有区别). 汉武帝把(约 100 个)郡国划成十三个州，分别派刺史(后来升级叫州牧)监察. 州作为监察单位逐渐实权化, 魏晋时期是州郡县三级, 南北朝州郡的数目膨胀,隋文帝废掉郡这一级变成州县一直延续到唐朝(隋炀帝和唐玄宗都出于个人喜好曾把州改成郡&amp;hellip;), 只是这时州已经300 多个了, 比较类似于最初的郡县. 州太多,所以在上边加一个道 (唐太宗按照“山川形便”划分十个道, 和九州很像, 玄宗增加到 15 个道),道也是虚级监察单位,和最初的州很像. 道的官员叫采访史(负责民事, 军事是节度使),就和汉朝最初州的刺史一样. 晚唐节度使权力越来越大,地方逐渐混乱,按照实际管辖区域作为道的话已经有 40 多个, 和今天的省比较像了. 宋朝把道改成路(英语都叫circuit) 元朝改成省. 省是中书省的意思, 行省其实是中央临时派人管理地方的行为. 明把地方权力分为三司分别向中央负责, 但省表示一个大区域的这个名字流传了下来. 分权会带来混乱, 所以中央又要再派巡抚总督. 清朝巡抚总督常态化, 约等于集权的省长了. 省字的来源也比较有趣, 原本是指皇帝待的地方. 尚书中书这些大概是皇帝的秘书, 他们成为机关之后就称 xx 省了(和后来的军机处有点像, 历史就是在不停重复, 中央和地方的权力变来变去就是这几种模式). 这时的省显然不能叫 province. 部则本来就是管理不同垂直业务的单位, 翻译成 ministry 和 department 都没问题.&lt;/p&gt;</description></item><item><title>非典型题目: 恢复被打乱的神经网络层序</title><link>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</link><pubDate>Sun, 17 May 2026 00:00:00 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/i-dropped-a-neural-net/</guid><description>&lt;h2 id="背景"&gt;背景&lt;/h2&gt;
&lt;p&gt;题目来源是 Jane Street: &lt;a href="https://huggingface.co/spaces/jane-street/droppedaneuralnet"&gt;https://huggingface.co/spaces/jane-street/droppedaneuralnet&lt;/a&gt; . 看到题目的第一反应是, 有数据有参数恢复一个 permutation, 这应该很简单吧? Jane Street 降智了? 正好拿来试试 AI 的能力.&lt;/p&gt;
&lt;h2 id="解题过程"&gt;解题过程&lt;/h2&gt;
&lt;p&gt;题目直接给 Codex (26 年春节后不久的某个版本) 它的方向完全不对, 说明这至少是一道全新的题目, 不 trivial.&lt;/p&gt;
&lt;p&gt;给了几个粗暴的 data driven 思路让 Codex 尝试, 比如用给的数据训练一些同样结构的网络再学层序和参数的相关性, 都有一些效果但很快卡住, 也不知道离正确答案差多远, 48 层的 permutation 刚好碰到 NP-hard 的强度, 题目还是有点水平的.&lt;/p&gt;
&lt;p&gt;重新仔细审题, 发现 residual 的线索: 后层 bias 不仅直接连到输出, 也互相通过 residual 连接, (一部分)梯度是稳定传递的. 按这个思路根据 bias 相似性排序,能得到很漂亮的图. 解决一半了.&lt;/p&gt;
&lt;p&gt;这时候大意了,又觉得题目简单, 又丢给 Codex data driven 学前后层的关联, 效果还是很差. 启动人脑思考, 回忆起读博时那些让人痛苦的近似算法, 至少要有一个 heuristic 方向, 突然醒悟 loss 就是现成的 heuristic. 然后又大意了, 让 Codex 按 loss 搜索, 弄出了一坨愚蠢而勤奋的 beam search. 无奈又启动人脑思考, 现在的问题是: 每次选一层, 中间步骤没有反馈, 全部选完可以得到结果. RL啊, 显然是 RL, 这还要人脑想么, AI 这都意识不到? 失望.&lt;/p&gt;</description></item><item><title>欧拉公式</title><link>https://chenzhao.github.io/zh/articles/euler-formula/</link><pubDate>Tue, 10 Mar 2026 15:25:28 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/euler-formula/</guid><description>&lt;p&gt;函数性质的角度:&lt;/p&gt;
&lt;p&gt;指数函数是导数/增长率就是自身, 或者速度等于位置: $y&amp;rsquo;=y \space \iff \space y=e^x$&lt;/p&gt;
&lt;p&gt;照这个思路扩展一下:&lt;/p&gt;
&lt;p&gt;增长率的增长率是自身呢? 还是指数函数, 因为增长率被限制在了自身, 也不会更快了.&lt;/p&gt;
&lt;p&gt;增长率与自身相反呢? 负指数函数.&lt;/p&gt;
&lt;p&gt;增长率的增长率与自身相反呢? 竟然是三角函数!
$y&amp;rsquo;&amp;rsquo;=-y \space \iff \space y=A\cos x+B\sin x$&lt;/p&gt;
&lt;p&gt;加速度与位置相反, 也就是反复震荡的简谐振动. 三角函数就是简谐振动在时间上的振幅.
另一个角度,三角函数和简谐振动都是圆周上匀速运动的投影. 三者可以互相转换.&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;从简谐运动到圆:&lt;/p&gt;
&lt;p&gt;时间 t 时的简谐振动位于 y 速度 v, 二者的变化关系是: $\dot y=v,\space \dot v=-y$.&lt;/p&gt;
&lt;p&gt;即, $t+\Delta t$ 时: 速度是 $v-y\Delta t$, 位置是 $y+v\Delta t$,&lt;/p&gt;
&lt;p&gt;即 $(y,v)$ 的变化量是 $(v,-y)$, 在 $(y,v)$ 的空间里, 这是一个永远垂直的变化量, 最终会成为一个圆周.&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;从圆到三角函数(圆可以是离原点距离不变的路径, 也可以是垂直于原点方向移动,效果是一样的):&lt;/p&gt;
&lt;p&gt;时间 t 的原点为圆心半径 R 的逆时针圆周运动位于第一象限 $(x,y)$, 与 x 轴弧度 $\theta$ (i.e. $x=R\cos\theta, y=R\sin\theta$), 速度 v,&lt;/p&gt;</description></item><item><title>机器学习中的错误数据</title><link>https://chenzhao.github.io/zh/articles/weak-supervision/</link><pubDate>Sun, 11 Jan 2026 00:35:08 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/weak-supervision/</guid><description>&lt;p&gt;尝试理清楚机器学习数据的错误是哪来的以及如何处理.&lt;/p&gt;
&lt;p&gt;监督学习可以在给定 $X Y$
的前提下 work 是很直观的, 选一个 hypothesis $X Y \sim P $
推断 P 的参数即可, 懂基本的统计概率知识就能理解. 然而有些工作 claim 没有准确的 Y 也能 work , 就没那么直观了.&lt;/p&gt;
&lt;p&gt;最简单的情况, 二分类器 h 在真实世界的表现叫 true risk/generalization error R(h) 是观察不到的, 但可以用有限 X Y 得到的empirical risk $\hat{R}(h)$ 去估计, 两者的差距叫做 generalization gap. PAC 理论在这里用 hoeffding 不等式 (简化形式)
$$P(\hat{\mu}-\mu \geq \epsilon ) \leq e^{-2n\epsilon^2}$$
给一个宽到除了推公式就没什么用的 bound:
$$ R(h) \leq \hat{R}(h) + \sqrt{\frac{\ln(2/\delta)}{2n}} , \delta= 2e^{-2n\epsilon^2}$$
不过至少证明了: 数据越多估计越准(废话&amp;hellip;), 具体影响是 $O(\frac{1}{\sqrt{n}})$&lt;/p&gt;</description></item><item><title>指数对数</title><link>https://chenzhao.github.io/zh/articles/exponentials-and-logarithms/</link><pubDate>Fri, 05 Dec 2025 00:00:00 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/exponentials-and-logarithms/</guid><description>&lt;p&gt;对于原本是用相乘结合的概念, 比如独立事件的概率, 每个阶段的状态总数(热力学熵), 串联的增益(分贝)等, 如果要设计一个新指标, 用来表示这个概念的某个性质, 但是是相加的关系,这个新指标就只能选择对数形式, 因为只有对数满足本来相乘的东西相加起来继续可以相乘.&lt;/p&gt;
&lt;p&gt;数学语言的话, 满足 $\phi(xy)=\phi(x)+\phi(y)$ 的泛函只有 $\phi(x)=c\ln x$. 证明很简单: 固定 x 对 y 求导得 $x\phi&amp;rsquo;(xy)=\phi&amp;rsquo;(y)$, 令 y=1 有 $x\phi&amp;rsquo;(x)=\phi&amp;rsquo;(1)$ 即 $\phi&amp;rsquo;(x) = \frac{c}{x}$ . 反过来类似, 满足 $\psi(s+t)=\psi(s)\psi(t)$的只有 $\psi(t)=e^{ct}$ .&lt;/p&gt;
&lt;p&gt;再抽象一点, 指数是加法群到乘法群的唯一连续同态. 这个特点表现为 导数是自身 或者 连续增长的极限 . 写出来就是:
$$f(x+y)=f(x)f(y)$$&lt;/p&gt;
&lt;p&gt;$$\frac{f(x+y)-f(x)}{y}=f(x)\frac{f(y)-1}{y}$$
当 y 趋近于 0 时,
$$f&amp;rsquo;(x)=f(x)f&amp;rsquo;(0)$$
当 x=y=t/n 时,
$$f(\frac{t}{n}+ \frac{t}{n}+ &amp;hellip;) = f(\frac{t}{n})f(\frac{t}{n})*&amp;hellip;$$
n很大时 $f(\frac{t}{n})= f(0)+f&amp;rsquo;(0)\frac{t}{n}=1+f&amp;rsquo;(0)\frac{t}{n}$, 即
$$f(t)=(1+f&amp;rsquo;(0)\frac{t}{n})^n$$
so, 从乘法到加法, 导数是自身, 增长的极限 三个情况其实是一件事, 都只有指数是唯一解.&lt;/p&gt;
&lt;h4 id="概率和信息量"&gt;概率和信息量&lt;/h4&gt;
&lt;p&gt;最典型的例子概率和信息量, 一个概率是 p 的事件的信息量只能是p 的对数如果满足: 两件(独立)事的信息量之和显然是相加的, 或者说通过不同流程获取一件事最终得到的信息量应该是一样的, 即信息量与观察的方式无关. 对于事件 $A\subseteq B\subseteq C$, 已知 C, 直接从 C 到 A的信息量与 先从 C 到 B, 再从 B 到 A 的信息量之和应当一样, 即,
$I(A\mid C)=I(B\mid C)+I(A\mid B)$ , 又有 $P(A\mid C)=P(B\mid C),P(A\mid B)$ 所以I和 P 的关系就是泛函$I=\phi(P)$ 满足 $\phi(xy)=\phi(x)+\phi(y)$ , 要素出现, 也就只能是对数. 一般用$-\log p$ 更符合直觉.&lt;/p&gt;</description></item></channel></rss>