随机矩阵投影长度保持引理及其证明

原论文中的引理 2 \textbf{2} 2

1. \textbf{1. } 1. 引理 1 \textbf{1} 1(前提之一)

1.1. \textbf{1.1. } 1.1. 引理 1 \textbf{1} 1的内容

👉前提: X ∼ N ( 0 , σ ) X\sim{}N(0,\sigma) XN(0,σ) f ( x ) = 1 2 π σ e – x 2 2 σ 2 f(x)\text{=}\cfrac{1}{\sqrt{2\pi}\sigma}e^{–\frac{x^{2}}{2\sigma^{2}}} f(x)=2π σ1e2σ2x2,且 ∀ α < 1 2 σ 2 \forall{}\alpha{}\text{<}\cfrac{1}{2\sigma^{2}} α<2σ21

👉结论: E [ e α X 2 ] = 1 1 – 2 α σ 2 \mathrm{E}\left[e^{\alpha{}X^{2}}\right]\text{=}\cfrac{1}{\sqrt{1–2\alpha{}\sigma^{2}}} E[eαX2]=1–2ασ2 1

2. \textbf{2. } 2. 引理 1 \textbf{1} 1的证明

E [ e α X 2 ] = ∫ – ∞ ∞ e α x 2 f ( x ) d x = ∫ – ∞ ∞ e α x 2 ⋅ 1 2 π σ e – x 2 2 σ 2 d x = ∫ – ∞ ∞ 1 2 π σ e – x 2 2 σ 2 ( 1 – 2 α σ 2 ) d x \displaystyle{}\mathrm{E}\left[e^{\alpha{}X^2}\right]\text{=}\int_{–\infty}^{\infty}e^{\alpha{}x^2}f(x)dx\text{=}\int_{–\infty}^{\infty} e^{\alpha x^2} \cdot \frac{1}{\sqrt{2 \pi} \sigma} e^{–\frac{x^2}{2 \sigma^2}} d x\text{=}\int_{–\infty}^{\infty} \frac{1}{\sqrt{2 \pi} \sigma} e^{–\frac{x^2}{2 \sigma^2}\left(1–2 \alpha \sigma^2\right)} d x E[eαX2]=–∞eαx2f(x)dx=–∞eαx22π σ1e2σ2x2dx=–∞2π σ1e2σ2x2(1–2ασ2)dx

↪令 σ ′ = σ 1 – 2 α σ 2 \sigma^{\prime}=\cfrac{\sigma}{\sqrt{1–2 \alpha \sigma^2}} σ=1–2ασ2 σ,其中必定要求 1 – 2 α σ 2 >0 1–2 \alpha \sigma^2\text{>0} 1–2ασ2>0 α < 1 2 σ 2 \alpha{}\text{<}\cfrac{1}{2\sigma^{2}} α<2σ21

E [ e α X 2 ] = ∫ – ∞ ∞ 1 – 2 α σ 2 2 π σ 1 – 2 α σ 2 e – x 2 2 σ 2 ( 1 – 2 α σ 2 ) d x = 1 1 – 2 α σ 2 ∫ − ∞ ∞ 1 2 π σ ′ e − x 2 2 σ ′ 2 d x \displaystyle{}\mathrm{E}\left[e^{\alpha X^2}\right]\text{=}\int_{–\infty}^{\infty} \cfrac{\sqrt{1–2 \alpha \sigma^2}}{\sqrt{2 \pi} \sigma \sqrt{1–2 \alpha \sigma^2}} e^{–\frac{x^2}{2 \sigma^2}\left(1–2 \alpha \sigma^2\right)} d x\text{=}\cfrac{1}{\sqrt{1–2\alpha{}\sigma^{2}}}\int_{-\infty}^{\infty} \cfrac{1}{\sqrt{2 \pi} \sigma^{\prime}} e^{-\frac{x^2}{2 \sigma^{\prime 2}}} d x E[eαX2]=–∞2π σ1–2ασ2 1–2ασ2 e2σ2x2(1–2ασ2)dx=1–2ασ2 12π σ1e2σ′2x2dx

↪考虑到 ∫ − ∞ ∞ 1 2 π σ ′ e − x 2 2 σ ′ 2 d x = 1 \displaystyle{}\int_{-\infty}^{\infty} \frac{1}{\sqrt{2 \pi} \sigma^{\prime}} e^{-\frac{x^2}{2 \sigma^{\prime 2}}} d x\text{=}1 2π σ1e2σ′2x2dx=1,所以 E [ e α X 2 ] = 1 1 – 2 α σ 2 \mathrm{E}\left[e^{\alpha{}X^{2}}\right]\text{=}\cfrac{1}{\sqrt{1–2\alpha{}\sigma^{2}}} E[eαX2]=1–2ασ2 1

2. \textbf{2. } 2. 引理 2 \textbf{2} 2

2.1. \textbf{2.1. } 2.1. 引理 2 \textbf{2} 2的内容

👉前提 1 1 1:设一个随机矩阵 S = ( s i j ) ∈ R t × d S\text{=}(s_{ij})\text{∈}\mathbb{R}^{t\text{×}d} S=(sij)Rt×d,每个元素 s i j s_{ij} sij独立同分布于 N ( 0 , 1 ) N(0,1) N(0,1)

👉前提 2 2 2:对任意固定向量 u ∈ R d × 1 u\text{∈}\mathbb{R}^{d\text{×}1} uRd×1(即 u ′ u^{\prime} u不随机),定义 u ′ = 1 t ( S u ) u^{\prime}\text{=}\cfrac{1}{\sqrt{t}}(Su) u=t 1(Su)

👉:结论 1 1 1 E [ ∥ u ′ ∥ 2 ] = ∥ u ∥ 2 \text{E}\left[\left\|u^{\prime}\right\|^2\right]\text{=}\|u\|^2 E[u2]=u2,即 ∥ u ′ ∥ 2 \left\|u^{\prime}\right\|^2 u2 ∥ u ∥ 2 \|u\|^2 u2在统计学上是相等的

👉结论 2 2 2 Pr [ ∥ u ′ ∥ 2 ∉ ( 1 ± ε ) ∥ u ∥ 2 ] ≤ 2 e – ( ε 2 – ε 3 ) t 4 \text{Pr}\left[\left\|u^{\prime}\right\|^2\notin{}(1\text{±}\varepsilon{})\|u\|^2\right]\text{≤}2e^{–\left(\varepsilon{}^2–\varepsilon{}^3\right)\frac{t}{4}} Pr[u2/(1±ε)u2]2e(ε2ε3)4t,即 ∥ u ′ ∥ 2 \left\|u^{\prime}\right\|^2 u2 ∥ u ∥ 2 \|u\|^2 u2在实际值上偏差极小且可控

2.2. \textbf{2.2. } 2.2. 引理 2 \textbf{2} 2的证明

2.2.1. \textbf{2.2.1. } 2.2.1. 对结论 1 \textbf{1} 1的证明

↪对于 s i j ∼ N ( 0 , 1 ) s_{ij}\sim{}N(0,1) sijN(0,1),则有 S ⋅ j u = ∑ i = 1 d s i j u i ∼ N ( 0 , ∥ u ∥ 2 ) \displaystyle{}S_{\cdot{}j}u\text{=}\sum_{i=1}^{d}s_{ij}u_i\sim{}N(0,\|u\|^2) Sju=i=1dsijuiN(0,u2)

  • 均值 E [ S ⋅ j u ] =E [ ∑ i = 1 d s i j u i ] = ∑ i = 1 d u i E [ s i j ] = 0 \displaystyle{}\text{E}\left[S_{\cdot{}j}u\right]\text{=}\text{E}\left[\sum_{i=1}^ds_{ij}u_i\right]\text{=}\sum_{i=1}^du_i\text{E}\left[s_{ij}\right]\text{=}0 E[Sju]=E[i=1dsijui]=i=1duiE[sij]=0
  • 方差 Var [ S ⋅ j u ] =Var [ ∑ i = 1 d s i j u i ] = ∑ i = 1 d Var [ s i j u i ] = ∑ i = 1 d u i 2 Var [ s i j ] = ∑ i = 1 d u i 2 = ∥ u ∥ 2 \displaystyle{}\text{Var}\left[S_{\cdot{}j}u\right]\text{=}\text{Var}\left[\sum_{i=1}^ds_{ij}u_i\right]\text{=}\sum_{i=1}^d\text{Var}[s_{ij}u_i]\text{=}\sum_{i=1}^du_i^2\text{Var}[s_{ij}]\text{=}\sum_{i=1}^du_i^2\text{=}\|u\|^2 Var[Sju]=Var[i=1dsijui]=i=1dVar[sijui]=i=1dui2Var[sij]=i=1dui2=u2

↪正态分布性质 E [ X 2 ] = σ 2 \text{E}[X^2]\text{=}\sigma{}^2 E[X2]=σ2,所以 E [ ( S ⋅ j u ) 2 ] = ∥ u ∥ 2 \text{E}\left[\left(S_{\cdot{}j}u\right)^2\right]\text{=}\|u\|^2 E[(Sju)2]=u2

↪所以 E [ ∥ S u ∥ 2 ] =E [ ∑ j = 1 t ( S ⋅ j u ) 2 ] = ∑ j = 1 t E [ ( S ⋅ j u ) 2 ] = t ∥ u ∥ 2 \displaystyle{}\text{E}\left[\|Su\|^2\right]\text{=}\text{E}\left[\sum_{j\text{=}1}^t\left(S_{\cdot{}j}u\right)^2\right]\text{=}\sum_{j=1}^t\text{E}\left[\left(S_{\cdot{}j}u\right)^2\right]\text{=}t\|u\|^2 E[Su2]=E[j=1t(Sju)2]=j=1tE[(Sju)2]=tu2

↪根据 u ′ = 1 t ( S u ) u^{\prime}\text{=}\cfrac{1}{\sqrt{t}}(Su) u=t 1(Su),得到 ∥ u ′ ∥ 2 = 1 t ∥ S u ∥ 2 \left\|u^{\prime}\right\|^2\text{=}\cfrac{1}{t}\|Su\|^2 u2=t1Su2

↪所以 E [ ∥ u ′ ∥ 2 ] =E [ 1 t ∥ S u ∥ 2 ] = 1 t E [ ∥ S u ∥ 2 ] = 1 t ( t ∥ u ∥ 2 ) = ∥ u ∥ 2 \displaystyle{}\text{E}\left[\left\|u^{\prime}\right\|^2\right]\text{=}\text{E}\left[\cfrac{1}{t}\|Su\|^2\right]\text{=}\cfrac{1}{t}\text{E}\left[\|Su\|^2\right]\text{=}\cfrac{1}{t}\left(t\|u\|^2\right)\text{=}\|u\|^2 E[u2]=E[t1Su2]=t1E[Su2]=t1(tu2)=u2

2.2.2. \textbf{2.2.2. } 2.2.2. 对结论 2 \textbf{2} 2的证明(正半边)

↪考虑到 S ⋅ j u ∼ N ( 0 , ∥ u ∥ 2 ) \displaystyle{}S_{\cdot{}j}u\sim{}N(0,\|u\|^2) SjuN(0,u2),故将其归一化为 X j = S ⋅ j u ∥ u ∥ ∼ N ( 0 , 1 ) X_j\text{=}\cfrac{S_{\cdot{}j}u}{\|u\|}\sim{}N(0,1) Xj=uSjuN(0,1)

↪由此定义 X = ∑ j = 1 t X j 2 \displaystyle{}X\text{=}\sum_{j=1}^tX_j^2 X=j=1tXj2(自由度为 t t t χ 2 \chi^2 χ2分布),由此 ∥ u ′ ∥ 2 = 1 t ∥ S u ∥ 2 = 1 t ∑ j = 1 t ( S ⋅ j u ) 2 = ∥ u ∥ 2 1 t ∑ j = 1 t X j 2 = 1 t ∥ u ∥ 2 X \displaystyle{}\left\|u^{\prime}\right\|^2\text{=}\cfrac{1}{t}\|Su\|^2\text{=}\cfrac{1}{t}\sum_{j=1}^t\left(S_{\cdot{}j}u\right)^2\text{=}\|u\|^2\cfrac{1}{t}\sum_{j=1}^tX_j^2\text{=}\cfrac{1}{t}\|u\|^2X u2=t1Su2=t1j=1t(Sju)2=u2t1j=1tXj2=t1u2X

↪由此 Pr [ ∥ u ′ ∥ 2 ≥ ( 1 + ε ) ∥ u ∥ 2 ] =Pr [ X ≥ ( 1 + ε ) t ] \text{Pr}\left[\left\|u^{\prime}\right\|^2\text{≥}(1\text{+}\varepsilon)\|u\|^2\right]\text{=}\text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right] Pr[u2(1+ε)u2]=Pr[X(1+ε)t]

↪考虑马可夫不等式的指数形式: Pr [ X ≥ ( 1 + ε ) t ] =Pr [ e α X ≥ e α ( 1 + ε ) t ] ≤ E [ e α X ] e α ( 1 + ε ) t \text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right]\text{=}\text{Pr}\left[e^{\alpha{}X}\text{≥}e^{\alpha{}(1\text{+}\varepsilon{})t}\right]\text{≤}\cfrac{\text{E}\left[e^{\alpha{}X}\right]}{e^{\alpha{}(1\text{+}\varepsilon{})t}} Pr[X(1+ε)t]=Pr[eαXeα(1+ε)t]eα(1+ε)tE[eαX]

  • 考虑到 X = ∑ j = 1 t X j 2 \displaystyle{}X\text{=}\sum_{j=1}^tX_j^2 X=j=1tXj2,所以 E [ e α X ] =E [ e α ( X 1 2 + X 2 2 + ⋯ + X t 2 ) ] =E [ e α X 1 2 e α X 2 2 ⋯ e α X t 2 ] =E [ ∏ j = 1 t e α X j 2 ] = ∏ j = 1 t E [ e α X j 2 ] \displaystyle{}\text{E}\left[e^{\alpha{}X}\right]\text{=}\text{E}\left[e^{\alpha{}(X^2_1\text{+}X^2_2\text{+}\cdots\text{+}X^2_t)}\right]\text{=}\text{E}\left[e^{\alpha{}X^2_1}e^{\alpha{}X^2_2}\cdots{}e^{\alpha{}X^2_t}\right]\text{=}\text{E}\left[\prod_{j=1}^te^{\alpha{}X^2_j}\right]\text{=}\prod_{j=1}^t\text{E}\left[e^{\alpha{}X_j^2}\right] E[eαX]=E[eα(X12+X22++Xt2)]=E[eαX12eαX22eαXt2]=E[j=1teαXj2]=j=1tE[eαXj2]
  • 在引理 1 1 1中已经证明 E [ e α X j 2 ] = 1 1 – 2 α σ 2 ( α < 1 2 σ 2 ) \text{E}\left[e^{\alpha{}X_j^{2}}\right]\text{=}\cfrac{1}{\sqrt{1–2\alpha{}\sigma^{2}}}(\alpha{}\text{<}\cfrac{1}{2\sigma^{2}}) E[eαXj2]=1–2ασ2 1(α<2σ21),考虑到此处 σ ( X j ) = 1 \sigma({X_j})\text{=}1 σ(Xj)=1所以 E [ e α X j 2 ] = 1 1 – 2 α ( α < 1 2 ) \text{E}\left[e^{\alpha{}X_j^{2}}\right]\text{=}\cfrac{1}{\sqrt{1–2\alpha{}}}(\alpha{}\text{<}\cfrac{1}{2}) E[eαXj2]=1–2α 1(α<21)
  • 所以 E [ e α X ] = ∏ j = 1 t ( 1 1 – 2 α ) = ( 1 1 – 2 α ) t = 1 ( 1 – 2 α ) t 2 \displaystyle{}\text{E}\left[e^{\alpha{}X}\right]\text{=}\prod_{j=1}^t\left(\cfrac{1}{\sqrt{1–2\alpha{}}}\right)\text{=}\left(\cfrac{1}{\sqrt{1–2\alpha{}}}\right)^t\text{=}\cfrac{1}{(1–2\alpha)^{\frac{t}{2}}} E[eαX]=j=1t(1–2α 1)=(1–2α 1)t=(1–2α)2t1
  • 代入原式得 Pr [ X ≥ ( 1 + ε ) t ] ≤ E [ e α X ] e α ( 1 + ε ) t = ( 1 – 2 α ) – t 2 e α ( 1 + ε ) t = ( e – 2 ( 1 + ε ) α 1 – 2 α ) t 2 \text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right]\text{≤}\cfrac{\text{E}\left[e^{\alpha{}X}\right]}{e^{\alpha{}(1\text{+}\varepsilon{})t}}\text{=}\cfrac{{(1–2\alpha)^{–\frac{t}{2}}}}{e^{\alpha{}(1\text{+}\varepsilon{})t}}\text{=}\left(\cfrac{e^{–2(1\text{+}\varepsilon)\alpha}}{1–2\alpha}\right)^{\frac{t}{2}} Pr[X(1+ε)t]eα(1+ε)tE[eαX]=eα(1+ε)t(1–2α)2t=(1–2αe–2(1+ε)α)2t

↪对于 Pr [ X ≥ ( 1 + ε ) t ] ≤ ( e – 2 ( 1 + ε ) α 1 – 2 α ) t 2 \text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{–2(1\text{+}\varepsilon)\alpha}}{1–2\alpha}\right)^{\frac{t}{2}} Pr[X(1+ε)t](1–2αe–2(1+ε)α)2t,有必要在 0 < α < 1 2 0\text{<}\alpha{}\text{<}\cfrac{1}{2} 0<α<21的范围内确定 f ( α ) = ( e – 2 ( 1 + ε ) α 1 – 2 α ) t 2 f(\alpha)\text{=}\left(\cfrac{e^{–2(1\text{+}\varepsilon)\alpha}}{1–2\alpha}\right)^{\frac{t}{2}} f(α)=(1–2αe–2(1+ε)α)2t的最小值

  • 对于 ln ⁡ ( f ( α ) ) = t 2 [ – 2 ( 1 + ε ) α – ln ⁡ ( 1 – 2 α ) ] \ln(f(\alpha))\text{=}\cfrac{t}{2}[–2(1\text{+}\varepsilon)\alpha–\ln(1–2\alpha)] ln(f(α))=2t[–2(1+ε)αln(1–2α)],令 g ( α ) =– 2 ( 1 + ε ) α – ln ⁡ ( 1 – 2 α ) g(\alpha)\text{=}–2(1\text{+}\varepsilon)\alpha–\ln(1–2\alpha) g(α)=–2(1+ε)αln(1–2α),如下图( ε = 3 \varepsilon\text{=}3 ε=3)

    image-20250123232509535
  • 一阶导 d g ( α ) d α = 2 1 – 2 α – 2 ( 1 + ε ) \cfrac{\text{d}g{(\alpha)}}{\text{d}\alpha}\text{=}\cfrac{2}{1–2\alpha}–2(1\text{+}\varepsilon) dαdg(α)=1–2α2–2(1+ε),具有临界点 α ∗ = ε 2 ( 1 + ε ) ∈ ( 0 , 1 2 ) \alpha^*\text{=}\cfrac{\varepsilon}{2(1\text{+}\varepsilon)}\text{∈}\left(0,\cfrac{1}{2}\right) α=2(1+ε)ε(0,21),故 ε > 0 \varepsilon\text{>}0 ε>0

  • 代入原式即得 Pr [ X ≥ ( 1 + ε ) t ] ≤ ( e – 2 ( 1 + ε ) α 1 – 2 α ) t 2 ≤ ( ( 1 + ε ) e – ε ) t 2 \text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{–2(1\text{+}\varepsilon)\alpha}}{1–2\alpha}\right)^{\frac{t}{2}}\text{≤}\left((1\text{+}\varepsilon) e^{–\varepsilon}\right)^{\frac{t}{2}} Pr[X(1+ε)t](1–2αe–2(1+ε)α)2t((1+ε)eε)2t

↪进一步对 h ( ε ) = ( ( 1 + ε ) e – ε ) t 2 h(\varepsilon)\text{=}\left((1\text{+}\varepsilon)e^{–\varepsilon}\right)^{\frac{t}{2}} h(ε)=((1+ε)eε)2t的分析

  • 泰勒展开 ln ⁡ ( 1 + ε ) = ε – ε 2 2 + ε 3 3 + O ( ε 4 ) \ln{}(1\text{+}\varepsilon)\text{=}\varepsilon–\cfrac{\varepsilon^2}{2}\text{+}\cfrac{\varepsilon^3}{3}\text{+}O\left(\varepsilon^4\right) ln(1+ε)=ε2ε2+3ε3+O(ε4),则 ln ⁡ ( 1 + ε ) – ε ≤– ε 2 2 + ε 3 3 ≤– 1 2 ( ε 2 – ε 3 ) \ln(1\text{+}\varepsilon)–\varepsilon\text{≤}–\cfrac{\varepsilon^2}{2}\text{+}\cfrac{\varepsilon^3}{3}\text{≤}–\cfrac{1}{2}\left(\varepsilon^2–\varepsilon^3\right) ln(1+ε)ε2ε2+3ε321(ε2ε3)
  • 故在 ln ⁡ ( h ( ε ) ) = t 2 ( ln ⁡ ( 1 + ε ) – ε ) ≤– t 4 ( ε 2 – ε 3 ) \ln(h(\varepsilon))\text{=}\cfrac{t}{2}(\ln(1\text{+}\varepsilon)–\varepsilon)\text{≤}–\cfrac{t}{4}\left(\varepsilon^2–\varepsilon^3\right) ln(h(ε))=2t(ln(1+ε)ε)4t(ε2ε3),即 h ( ε ) ≤ e – t 4 ( ε 2 – ε 3 ) h(\varepsilon)\text{≤}e^{–\frac{t}{4}\left(\varepsilon^2–\varepsilon^3\right)} h(ε)e4t(ε2ε3)

↪最后 Pr [ ∥ u ′ ∥ 2 ≥ ( 1 + ε ) ∥ u ∥ 2 ] =Pr [ X ≥ ( 1 + ε ) t ] ≤ ( e – 2 ( 1 + ε ) α 1 – 2 α ) t 2 ≤ ( ( 1 + ε ) e – ε ) t 2 ≤ e – t 4 ( ε 2 – ε 3 ) \text{Pr}\left[\left\|u^{\prime}\right\|^2\text{≥}(1\text{+}\varepsilon)\|u\|^2\right]\text{=}\text{Pr}\left[X\text{≥}(1\text{+}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{–2(1\text{+}\varepsilon)\alpha}}{1–2\alpha}\right)^{\frac{t}{2}}\text{≤}\left((1\text{+}\varepsilon) e^{–\varepsilon}\right)^{\frac{t}{2}}\text{≤}e^{–\frac{t}{4}\left(\varepsilon^2–\varepsilon^3\right)} Pr[u2(1+ε)u2]=Pr[X(1+ε)t](1–2αe–2(1+ε)α)2t((1+ε)eε)2te4t(ε2ε3)

2.2.3. \textbf{2.2.3. } 2.2.3. 对结论 2 \textbf{2} 2的证明(负半边)

↪考虑到 S ⋅ j u ∼ N ( 0 , ∥ u ∥ 2 ) \displaystyle{}S_{\cdot{}j}u\sim{}N(0,\|u\|^2) SjuN(0,u2),故将其归一化为 X j = S ⋅ j u ∥ u ∥ ∼ N ( 0 , 1 ) X_j\text{=}\cfrac{S_{\cdot{}j}u}{\|u\|}\sim{}N(0,1) Xj=uSjuN(0,1)

↪由此定义 X = ∑ j = 1 t X j 2 \displaystyle{}X\text{=}\sum_{j=1}^tX_j^2 X=j=1tXj2(自由度为 t t t χ 2 \chi^2 χ2分布),由此 ∥ u ′ ∥ 2 = 1 t ∥ S u ∥ 2 = 1 t ∑ j = 1 t ( S ⋅ j u ) 2 = ∥ u ∥ 2 1 t ∑ j = 1 t X j 2 = 1 t ∥ u ∥ 2 X \displaystyle{}\left\|u^{\prime}\right\|^2\text{=}\cfrac{1}{t}\|Su\|^2\text{=}\cfrac{1}{t}\sum_{j=1}^t\left(S_{\cdot{}j}u\right)^2\text{=}\|u\|^2\cfrac{1}{t}\sum_{j=1}^tX_j^2\text{=}\cfrac{1}{t}\|u\|^2X u2=t1Su2=t1j=1t(Sju)2=u2t1j=1tXj2=t1u2X

↪由此 Pr [ ∥ u ′ ∥ 2 ≤ ( 1 – ε ) ∥ u ∥ 2 ] =Pr [ X ≤ ( 1 – ε ) t ] =Pr [ – X ≥– ( 1 – ε ) t ] \text{Pr}\left[\left\|u^{\prime}\right\|^2\text{≤}(1\text{–}\varepsilon)\|u\|^2\right]\text{=}\text{Pr}\left[X\text{≤}(1\text{–}\varepsilon{})t\right]\text{=}\text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right] Pr[u2(1ε)u2]=Pr[X(1ε)t]=Pr[X(1ε)t]

↪考虑马可夫不等式的指数形式: Pr [ – X ≥– ( 1 – ε ) t ] =Pr [ e α ( – X ) ≥ e – α ( 1 – ε ) t ] ≤ E [ e – α X ] e – α ( 1 – ε ) t \text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right]\text{=}\text{Pr}\left[e^{\alpha{}(–X)}\text{≥}e^{–\alpha{}(1\text{–}\varepsilon{})t}\right]\text{≤}\cfrac{\text{E}\left[e^{–\alpha{}X}\right]}{e^{–\alpha{}(1\text{–}\varepsilon{})t}} Pr[X(1ε)t]=Pr[eα(X)eα(1ε)t]eα(1ε)tE[eαX]

  • 考虑到 X = ∑ j = 1 t X j 2 \displaystyle{}X\text{=}\sum_{j=1}^tX_j^2 X=j=1tXj2,所以 E [ e – α X ] =E [ e – α ( X 1 2 + X 2 2 + ⋯ + X t 2 ) ] =E [ e – α X 1 2 e – α X 2 2 ⋯ e – α X t 2 ] =E [ ∏ j = 1 t e – α X j 2 ] = ∏ j = 1 t E [ e – α X j 2 ] \displaystyle{}\text{E}\left[e^{–\alpha{}X}\right]\text{=}\text{E}\left[e^{–\alpha{}(X^2_1\text{+}X^2_2\text{+}\cdots\text{+}X^2_t)}\right]\text{=}\text{E}\left[e^{–\alpha{}X^2_1}e^{–\alpha{}X^2_2}\cdots{}e^{–\alpha{}X^2_t}\right]\text{=}\text{E}\left[\prod_{j=1}^te^{–\alpha{}X_j^2}\right]\text{=}\prod_{j=1}^t\text{E}\left[e^{–\alpha{}X_j^2}\right] E[eαX]=E[eα(X12+X22++Xt2)]=E[eαX12eαX22eαXt2]=E[j=1teαXj2]=j=1tE[eαXj2]
  • 在引理 1 1 1中已经证明 E [ e – α X j 2 ] = 1 1 + 2 α σ 2 ( α >– 1 2 σ 2 ) \text{E}\left[e^{–\alpha{}X_j^{2}}\right]\text{=}\cfrac{1}{\sqrt{1\text{+}2\alpha{}\sigma^{2}}}(\alpha{}\text{>}–\cfrac{1}{2\sigma^{2}}) E[eαXj2]=1+2ασ2 1(α>2σ21),考虑到此处 σ ( X j ) = 1 \sigma({X_j})\text{=}1 σ(Xj)=1所以 E [ e – α X j 2 ] = 1 1 + 2 α ( α >– 1 2 ) \text{E}\left[e^{–\alpha{}X_j^{2}}\right]\text{=}\cfrac{1}{\sqrt{1\text{+}2\alpha{}}}(\alpha{}\text{>}–\cfrac{1}{2}) E[eαXj2]=1+2α 1(α>21)
  • 所以 E [ e – α X ] = ∏ j = 1 t ( 1 1 + 2 α ) = ( 1 1 + 2 α ) t = 1 ( 1 + 2 α ) t 2 \displaystyle{}\text{E}\left[e^{–\alpha{}X}\right]\text{=}\prod_{j=1}^t\left(\cfrac{1}{\sqrt{1\text{+}2\alpha{}}}\right)\text{=}\left(\cfrac{1}{\sqrt{1\text{+}2\alpha{}}}\right)^t\text{=}\cfrac{1}{(1\text{+}2\alpha)^{\frac{t}{2}}} E[eαX]=j=1t(1+2α 1)=(1+2α 1)t=(1+2α)2t1
  • 代入原式得 Pr [ – X ≥– ( 1 – ε ) t ] ≤ E [ e – α X ] e – α ( 1 – ε ) t = ( 1 + 2 α ) – t 2 e – α ( 1 – ε ) t = ( e 2 ( 1 – ε ) α 1 + 2 α ) t 2 \text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right]\text{≤}\cfrac{\text{E}\left[e^{–\alpha{}X}\right]}{e^{–\alpha{}(1–\varepsilon{})t}}\text{=}\cfrac{{(1\text{+}2\alpha)^{–\frac{t}{2}}}}{e^{–\alpha{}(1–\varepsilon{})t}}\text{=}\left(\cfrac{e^{2(1–\varepsilon)\alpha}}{1\text{+}2\alpha}\right)^{\frac{t}{2}} Pr[X(1ε)t]eα(1–ε)tE[eαX]=eα(1–ε)t(1+2α)2t=(1+2αe2(1–ε)α)2t

↪对于 Pr [ – X ≥– ( 1 – ε ) t ] ≤ ( e 2 ( 1 – ε ) α 1 + 2 α ) t 2 \text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{2(1–\varepsilon)\alpha}}{1\text{+}2\alpha}\right)^{\frac{t}{2}} Pr[X(1ε)t](1+2αe2(1–ε)α)2t,有必要在 α >– 1 2 \alpha{}\text{>}–\cfrac{1}{2} α>21的范围内确定 f ( α ) = ( e 2 ( 1 – ε ) α 1 + 2 α ) t 2 f(\alpha)\text{=}\left(\cfrac{e^{2(1–\varepsilon)\alpha}}{1\text{+}2\alpha}\right)^{\frac{t}{2}} f(α)=(1+2αe2(1–ε)α)2t的最小值

  • 对于 ln ⁡ ( f ( α ) ) = t 2 [ 2 ( 1 – ε ) α – ln ⁡ ( 1 + 2 α ) ] \ln(f(\alpha))\text{=}\cfrac{t}{2}[2(1–\varepsilon)\alpha–\ln(1\text{+}2\alpha)] ln(f(α))=2t[2(1–ε)αln(1+2α)],令 g ( α ) = [ 2 ( 1 – ε ) α – ln ⁡ ( 1 + 2 α ) ] g(\alpha)\text{=}[2(1–\varepsilon)\alpha–\ln(1\text{+}2\alpha)] g(α)=[2(1–ε)αln(1+2α)],如下图( ε =– 1 3 \varepsilon\text{=}–\cfrac{1}{3} ε=31)
    image-20250123232509535
  • 一阶导 d g ( α ) d α =– 2 1 + 2 α + 2 ( 1 + ε ) \cfrac{\text{d}g{(\alpha)}}{\text{d}\alpha}\text{=}–\cfrac{2}{1\text{+}2\alpha}\text{+}2(1\text{+}\varepsilon) dαdg(α)=1+2α2+2(1+ε),具有临界点 α ∗ = ε 2 ( 1 – ε ) ∈ ( – 1 2 , +∞ ) \alpha^*\text{=}\cfrac{\varepsilon}{2(1–\varepsilon)}\text{∈}\left(–\cfrac{1}{2},\text{+∞}\right) α=2(1–ε)ε(21,+∞),故 – 1 < ε < 1 –1\text{<}\varepsilon\text{<}1 –1<ε<1(由于前提限制故截取为 0 < ε < 1 0\text{<}\varepsilon\text{<}1 0<ε<1)
  • 代入原式即得 Pr [ – X ≥– ( 1 – ε ) t ] ≤ ( e 2 ( 1 – ε ) α 1 + 2 α ) t 2 ≤ ( ( 1 – ε ) e ε ) t 2 \text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{2(1–\varepsilon)\alpha}}{1\text{+}2\alpha}\right)^{\frac{t}{2}}\text{≤}\left((1–\varepsilon) e^{\varepsilon}\right)^{\frac{t}{2}} Pr[X(1ε)t](1+2αe2(1–ε)α)2t((1–ε)eε)2t

↪进一步对 h ( ε ) = ( ( 1 – ε ) e ε ) t 2 h(\varepsilon)\text{=}\left((1–\varepsilon) e^{\varepsilon}\right)^{\frac{t}{2}} h(ε)=((1–ε)eε)2t的分析

  • 泰勒展开 ln ⁡ ( 1 – ε ) =– ε – ε 2 2 – ε 3 3 + O ( ε 4 ) \ln{}(1–\varepsilon)\text{=}–\varepsilon–\cfrac{\varepsilon^2}{2}–\cfrac{\varepsilon^3}{3}\text{+}O\left(\varepsilon^4\right) ln(1–ε)=ε2ε23ε3+O(ε4),则 ln ⁡ ( 1 – ε ) + ε ≤– ε 2 2 – ε 3 3 ≤– 1 2 ( ε 2 – ε 3 ) \ln(1–\varepsilon)\text{+}\varepsilon\text{≤}–\cfrac{\varepsilon^2}{2}–\cfrac{\varepsilon^3}{3}\text{≤}–\cfrac{1}{2}\left(\varepsilon^2–\varepsilon^3\right) ln(1–ε)+ε2ε23ε321(ε2ε3)
  • 故在 ln ⁡ ( h ( ε ) ) = t 2 ( ln ⁡ ( 1 – ε ) + ε ) ≤– t 4 ( ε 2 – ε 3 ) \ln(h(\varepsilon))\text{=}\cfrac{t}{2}(\ln(1–\varepsilon)\text{+}\varepsilon)\text{≤}–\cfrac{t}{4}\left(\varepsilon^2–\varepsilon^3\right) ln(h(ε))=2t(ln(1–ε)+ε)4t(ε2ε3),即 h ( ε ) ≤ e – t 4 ( ε 2 – ε 3 ) h(\varepsilon)\text{≤}e^{–\frac{t}{4}\left(\varepsilon^2–\varepsilon^3\right)} h(ε)e4t(ε2ε3)

↪最后 Pr [ ∥ u ′ ∥ 2 ≤ ( 1 – ε ) ∥ u ∥ 2 ] =Pr [ – X ≥– ( 1 – ε ) t ] ≤ ( e 2 ( 1 – ε ) α 1 + 2 α ) t 2 ≤ ( ( 1 – ε ) e ε ) t 2 ≤ e – t 4 ( ε 2 – ε 3 ) \text{Pr}\left[\left\|u^{\prime}\right\|^2\text{≤}(1\text{–}\varepsilon)\|u\|^2\right]\text{=}\text{Pr}\left[–X\text{≥}–(1\text{–}\varepsilon{})t\right]\text{≤}\left(\cfrac{e^{2(1–\varepsilon)\alpha}}{1\text{+}2\alpha}\right)^{\frac{t}{2}}\text{≤}\left((1–\varepsilon) e^{\varepsilon}\right)^{\frac{t}{2}}\text{≤}e^{–\frac{t}{4}\left(\varepsilon^2–\varepsilon^3\right)} Pr[u2(1ε)u2]=Pr[X(1ε)t](1+2αe2(1–ε)α)2t((1–ε)eε)2te4t(ε2ε3)

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.mzph.cn/diannao/68130.shtml

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

C语言-构造数据类型

1、构造数据类型 结构体、共用体、枚举。 2、结构体 1、结构体的定义 结构体是一个自定义的复合数据类型&#xff0c;它允许将不同类型的数据组合在一起。 struct 结构体名 {数据类型1 成员变量1;数据类型2 成员变量2;数据类型3 成员变量3;数据类型4 成员变量4; } 2、结构体变…

Effective C++ 规则48: 认识 Template 元编程

1、什么是模板元编程 模板元编程是指利用 C 的模板机制&#xff0c;在编译期执行某些逻辑运算或代码生成的技术。通过模板元编程&#xff0c;可以在编译阶段完成类型推导、条件分支、递归计算等任务。C 语言的模板功能不仅仅是为了解决类型参数化的问题&#xff0c;它还可以在…

CSS:跑马灯

<div class"swiper-container"><div class"swiper-wrapper"><!-- 第一组 --><div class"item" v-for"item in cardList" :key"first-item.id"><img :src"item.image" alt""…

99.16 金融难点通俗解释:营业总收入

目录 0. 承前1. 简述2. 比喻&#xff1a;小明家的小卖部2.1 第一步&#xff1a;了解小卖部的收入来源2.2 第二步&#xff1a;计算一天的收入2.3 第三步&#xff1a;理解营业总收入 3. 生活中的例子3.1 小卖部的一周营业3.2 不同季节的变化 4. 小朋友要注意4.1 营业总收入不等于…

MyBatis Plus 的 InnerInterceptor:更轻量级的 SQL 拦截器

在 Spring Boot 项目中使用 MyBatis Plus 时&#xff0c;你可能会遇到 InnerInterceptor 这个概念。 InnerInterceptor 是 MyBatis Plus 提供的一种轻量级 SQL 拦截器&#xff0c;它与传统的 MyBatis 拦截器&#xff08;Interceptor&#xff09;有所不同&#xff0c;具有更简单…

CLOUDFLARE代理请求重定向你太多次

现象 使用CLOUDFLARE代理前请求正常&#xff0c;使用CLOUDFLARE代理请求后出现 原因分析 以下是我的猜测&#xff0c;在默认情况下 CLOUDFLARE代理&#xff0c;可能是直接请求我们服务器的IP&#xff0c;比如&#xff1a;http://1.1.1.1 而不是通过域名的方式&#xff08;如…

大模型开发 | RAG在实际开发中可能遇到的坑

近年来&#xff0c;大语言模型 (LLM) 的飞速发展令人瞩目&#xff0c;它们在各个领域展现出强大的应用潜力。然而&#xff0c;LLM 也存在一些固有的局限性&#xff0c;例如知识更新滞后、信息编造 (幻觉) 等问题。为了克服这些挑战&#xff0c;检索增强生成 (Retrieval-Augment…

DDD架构实战第五讲总结:将领域模型转化为代码

云架构师系列课程之DDD架构实战第五讲总结:将领域模型转化为代码 一、引言 在前几讲中,我们讨论了领域模型的重要性及其在业务分析中的渐进获得方法。本讲将聚焦于如何将领域模型转化为代码,使得开发人员能够更轻松地实现用户的领域模型。 二、从模型到代码:领域驱动设计…

AI Agent的多轮对话:提升用户体验的关键技巧

在前面的文章中&#xff0c;我们讨论了 AI Agent 的各个核心系统。今天&#xff0c;我想聊聊如何实现一个好用的多轮对话系统。说实话&#xff0c;这个话题我琢磨了很久&#xff0c;因为它直接影响到用户体验。 从一个槽点说起 还记得我最开始做对话系统时的一个典型场景&…

vue router路由复用及刷新问题研究

路由复用问题 当路由匹配路径未发生变化时&#xff0c;只是相关的参数发生了变化&#xff0c;路由跳转时&#xff0c;会发现虽然地址栏中的地址更新到了新的链接&#xff0c;但是页面渲染并未触发响应路由组件的created,mounted等钩子函数&#xff0c;也就意味着组件并没有被重…

Android各个版本存储权限适配

一、Android6.0-9.0 1、动态权限申请&#xff1a; private static String[] arrPermissions {android.Manifest.permission.READ_EXTERNAL_STORAGE, android.Manifest.permission.WRITE_EXTERNAL_STORAGE,android.Manifest.permission.ACCESS_FINE_LOCATION,android.Manifest.…

房租管理系统的智能化应用助推租赁行业高效运营与决策优化

内容概要 在现代租赁行业中&#xff0c;房租管理系统的智能化应用正在逐步成为一个不可或缺的工具。通过整合最新技术&#xff0c;这些系统为租赁管理的各个方面提供了极大的便利和效率提升。从房源管理到合同签署再到财务监控&#xff0c;智能化功能能够帮助运营者在繁琐的事…

数据结构初阶之队列的介绍与队列的实现

一、概念与结构 概念&#xff1a;只允许在一端进行插入数据操作&#xff0c;在另一端进行删除数据操作的特殊线性表&#xff0c;队列具有先进先出 FIFO (First In First Out) 的特点。 入队列&#xff1a;进行插入操作的一端称为队尾 出队列&#xff1a;进行删除操作的一端称为…

GTO 门级可关断晶闸管,全控性器件

介绍 门级可关断晶闸管是一种通过门极来控制器件导通和关断的电力半导体器件。 结构特点 - 四层半导体结构&#xff1a;与普通晶闸管相似&#xff0c;GTO也是由PNPN四层半导体构成&#xff0c;外部引出三个电极&#xff0c;分别是阳极&#xff08;A&#xff09;、阴极&#x…

FlinkSql使用中rank/dense_rank函数报错空指针

问题描述 在flink1.16(甚至以前的版本)中&#xff0c;使用rank()或者dense_rank()进行排序时&#xff0c;某些场景会导致报错空指针NPE(NullPointerError) 报错内容如下 该报错没有行号/错误位置&#xff0c;无法排查 现状 目前已经确认为bug&#xff0c;根据github上的PR日…

序列标注:从传统到现代,NLP中的标签预测技术全解析

引言 序列标注任务是自然语言处理&#xff08;NLP&#xff09;中的核心任务之一&#xff0c;广泛应用于信息抽取、文本分类、机器翻译等领域。随着深度学习技术的快速发展&#xff0c;序列标注任务的性能得到了显著提升。本文将从基础概念入手&#xff0c;逐步深入探讨序列标注…

CentOS 7 安装fail2ban hostdeny方式封禁ip —— 筑梦之路

centos 7 换源参考CentOS 7.9 停止维护(2024-6-30)后可用在线yum源 —— 筑梦之路_centos停止维护-CSDN博客 安装fail2ban yum install fail2ban 新增配置文件 cat > /etc/fail2ban/action.d/hostsdeny.conf << EOF [Definition] actionstart actionstop action…

速通Docker === Docker Compose

目录 Docker Compose 简介 Docker Compose 常用命令 使用 Docker Compose 启动 WordPress 普通启动方式&#xff08;使用 Docker 命令&#xff09; 使用 Docker Compose 启动 Docker Compose 的特性 Docker Compose 简介 Docker Compose 是一个用于定义和运行多容器 Dock…

关于BAR(PCIE BAR或AXI BAR)的解释

假设某BAR的默认值是xxxx_0000&#xff08;这里表示8个比特位&#xff09;&#xff0c;其中低4位不可写&#xff0c;可操作的最低位是4&#xff0c;所以该BAR的大小是2^416字节&#xff1b; 1、系统软件向BAR写0xFF 2、系统软件读BAR&#xff0c;读到的值是0xF0&#xff0c;于是…

MySQL 事件调度器

MySQL 事件调度器确实是一个更方便且内置的解决方案&#xff0c;可以在 MySQL 服务器端自动定期执行表优化操作&#xff0c;无需依赖外部工具或应用程序代码。这种方式也能减少数据库维护的复杂性&#xff0c;尤其适用于在数据库频繁更新或删除时进行自动化优化。 使用 MySQL …