<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Research on 我的赛博存档</title><link>https://chenzhao.github.io/zh/categories/research/</link><description>Recent content in Research on 我的赛博存档</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Sun, 11 Jan 2026 00:35:08 +0800</lastBuildDate><atom:link href="https://chenzhao.github.io/zh/categories/research/index.xml" rel="self" type="application/rss+xml"/><item><title>机器学习中的错误数据</title><link>https://chenzhao.github.io/zh/articles/weak-supervision/</link><pubDate>Sun, 11 Jan 2026 00:35:08 +0800</pubDate><guid>https://chenzhao.github.io/zh/articles/weak-supervision/</guid><description>&lt;p&gt;尝试理清楚机器学习数据的错误是哪来的以及如何处理.&lt;/p&gt;
&lt;p&gt;监督学习可以在给定 $X Y$
的前提下 work 是很直观的, 选一个 hypothesis $X Y \sim P $
推断 P 的参数即可, 懂基本的统计概率知识就能理解. 然而有些工作 claim 没有准确的 Y 也能 work , 就没那么直观了.&lt;/p&gt;
&lt;p&gt;最简单的情况, 二分类器 h 在真实世界的表现叫 true risk/generalization error R(h) 是观察不到的, 但可以用有限 X Y 得到的empirical risk $\hat{R}(h)$ 去估计, 两者的差距叫做 generalization gap. PAC 理论在这里用 hoeffding 不等式 (简化形式)
$$P(\hat{\mu}-\mu \geq \epsilon ) \leq e^{-2n\epsilon^2}$$
给一个宽到除了推公式就没什么用的 bound:
$$ R(h) \leq \hat{R}(h) + \sqrt{\frac{\ln(2/\delta)}{2n}} , \delta= 2e^{-2n\epsilon^2}$$
不过至少证明了: 数据越多估计越准(废话&amp;hellip;), 具体影响是 $O(\frac{1}{\sqrt{n}})$&lt;/p&gt;</description></item></channel></rss>