统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
基于分形数学的统计
我正在寻找有关基于分形数学的统计学的书籍/教科书。我知道这不是一个众所周知的领域,很难找到好的文学作品。欢迎任何建议(书籍,教科书,在线材料)。



4
对于给定的估算技术和参数,样本应为多大?
是否有经验法则或什至没有任何方法来说明样本的大小,以便用给定数量的参数估计模型? 因此,例如,如果我想估计具有5个参数的最小二乘回归,则样本应为多大? 您使用哪种估计技术(例如,最大似然,最小二乘,GMM),或者要执行多少测试或什么测试,有关系吗?做出决定时是否应考虑样本变异性?

1
如何找到在两个点的值之间具有统计上有意义的大离群比的样本点?
作为示例应用程序,请考虑Stack Overflow用户的以下两个属性:信誉和配置文件视图计数。 可以预期,对于大多数用户来说,这两个值将成比例:高级代表用户会引起更多关注,从而获得更多的个人资料视图。 因此,搜索具有很多个人资料视图(相对于他们的整体声誉)的用户来说很有趣。 这可能表明该用户具有外部声誉。也许只是他们有有趣的古怪图片和名称。 从数学上来说,每个二维采样点都是一个用户,并且每个用户都有两个整数值,范围从0到+无穷大: 声誉 个人资料查看次数 预计这两个参数是线性相关的,我们希望找到与该假设最大离群的样本点。 天真的解决方案当然是只采用个人资料视图,按声誉划分和排序。 但是,这将导致结果在统计上没有意义。例如,如果一个用户回答问题,获得1个赞,并且由于某种原因有10个个人资料视图,很容易伪造,那么该用户将出现在一个更有趣的候选人面前,该候选人具有1000个赞和5000个个人资料视图。 在一个更“现实世界”的用例中,我们可以尝试回答“哪些创业公司是最有意义的独角兽?”。例如,如果您以很少的资金投资1美元,就会创建一个独角兽:https ://www.linkedin.com/feed/update/urn:li:activity: 6362648516858310656 混凝土清洁易用的真实世界数据 要测试您的问题的解决方案,您可以使用从2019-03年Stack Overflow数据转储中提取的这个小型文件(压缩后为7500万,用户约为1000万): wget https://github.com/cirosantilli/media/raw/master/stack-overflow-data-dump/2019-03/users_rep_view.dat.7z 7z x users_rep_view.dat.7z 生成的UTF-8编码文件users_rep_view.dat具有非常简单的纯文本空间分隔格式: Id Reputation Views DisplayName -1 1 649 Community 1 45742 454747 Jeff_Atwood 2 3582 24787 Geoff_Dalgas 3 13591 24985 Jarrod_Dixon 4 29230 75102 Joel_Spolsky 5 39973 12147 …
12 ratio 

1
(熊猫)自相关图显示什么?
我是一个初学者,我想了解自相关图显示的内容。 我已经从不同来源(例如此页面或相关的Wikipedia页面)中阅读了一些解释,这里我不在此引用。 我有这个非常简单的代码,在那里我有我的索引日期一年和值简单地从0增加至365对每个指标。( 1984-01-01:0, 1984-01-02:1 ... 1984-12-31:365) import numpy as np import pandas as pd from pandas.plotting import autocorrelation_plot import matplotlib.pyplot as plt dr = pd.date_range(start='1984-01-01', end='1984-12-31') df = pd.DataFrame(np.arange(len(dr)), index=dr, columns=["Values"]) autocorrelation_plot(df) plt.show() 打印的图形将在哪里 我可以理解并查看为什么图形从以下位置1.00开始: 滞后为零的自相关始终等于1,因为这表示每个项与其自身之间的自相关。值和滞后为零的值将始终相同。 很好,但是为什么此图在滞后50时的值约为0.65?为什么会降到0以下?如果我没有显示自己的代码,是否可以推断出该自相关图显示了一个递增值的时间序列?如果是这样,您可以尝试向初学者解释它如何演绎吗?

1
外行对后门调整和前门调整之间差异的理解
我指的是后门调整和前门调整在这里: 后门调整:统计学中的原型流行病学问题是调整被测混杂因素的影响。Pearl的后门准则概括了这个想法。 前门调整:如果未发现某些变量,则我们可能需要求助于其他方法来确定因果关系。 该页面还为上述两个术语提供了精确的数学定义。 根据上述数学定义,您如何让外行人了解后门调节和前门调节之间的区别?
12 causality  dag 

2
ML中的softmax函数与热力学中的玻耳兹曼分布之间的联系有多深?
softmax函数通常在神经网络中用于将实数转换为概率,它与Boltzmann分布(在热力学中在给定温度T时,在整个能量平衡中,处于热平衡状态的粒子的概率分布)具有相同的函数。 我可以看到一些明显的启发性原因,这是可行的: 无论输入值是否为负,softmax都会输出正值,总和为1。 它总是可区分的,对于反向传播很方便。 它具有一个“温度”参数,用于控制网络对较小值的宽容度(当T很大时,所有结果均可能发生,当T很小时,仅选择输入最大的值)。 出于实际原因,玻尔兹曼函数是否仅用作softmax,还是与热力学/统计物理学有更深的联系?

3
将时间序列数据拆分为训练/测试/验证集
将时间序列数据拆分为训练/测试/验证集的最佳方法是什么,其中验证集将用于超参数调整? 我们拥有3年的每日销售数据,我们的计划是将2015-2016年用作培训数据,然后从2017年数据中随机抽取10周作为验证集,并从2017年数据中随机抽取10周作为测试集。然后,我们将在测试和验证集中的每一天向前走。


2
在CNN中选择过滤器大小,步幅等?
我一直在看斯坦福大学的CS231N讲座,我正在努力解决CNN架构中的一些问题。我要了解的是,是否存在一些用于选择卷积滤波器大小和步幅之类的通用准则,或者这是一门艺术而非一门科学? 据我了解,合并的存在主要是为了将某种形式的翻译不变性引入模型中。另一方面,我对如何选择步幅没有很好的直觉。除了试图压缩当前的层大小或试图为神经元获得更大的接受野外,还有其他指导方针吗?任何人都知道讨论此问题的好论文或类似文章吗?

4
MLE和交叉熵之间的联系在深度学习中有多有意义?
我了解给定了独立的观测值 的最大似然估计(或,等价地,具有平坦的MAP /均匀)之前标识所述参数\ mathbf {θ}产生该模型分布 P_ {模型} \ 与这些观测值最匹配的left(\,\ cdot \,; \ mathbf {θ} \ right)将是直径: = { Ö (1 ),。。。,o (m ) }mmmO={o(1),...,o(m)}O={o(1),...,o(m)}\mathbb{O}=\{\mathbf{o}^{(1)}, . . . , \mathbf{o}^{(m)}\}θθ\mathbf{θ}pmodel(⋅;θ)pmodel(⋅;θ)p_{model}\left(\,\cdot\, ; \mathbf{θ}\right) θML(O)=pmodel(O;θ)=argmaxθ‎‎∏i=1mpmodel(o(i);θ)θML(O)=pmodel(O;θ)=arg⁡maxθ‎‎∏i=1mpmodel(o(i);θ)\mathbf{θ}_{ML}(\mathbb{O})= p_{model}\left(\mathbb{O}; \mathbf{θ}\right) = \underset{\mathbf{θ}}{\arg\max}‎‎\prod_{i=1}^{m} p_{model}\left(\mathbf{o}^{(i)}; \mathbf{θ}\right) 或者,更方便 θML(O)=argminθ∑i=1m−logpmodel(o(i);θ)θML(O)=arg⁡minθ∑i=1m−log⁡pmodel(o(i);θ)\mathbf{θ}_{ML}(\mathbb{O})= \underset{\mathbf{θ}}{\arg\min}\sum_{i=1}^{m} -\log p_{model}\left(\mathbf{o}^{(i)}; \mathbf{θ}\right) 并了解θMLθML\mathbf{θ}_{ML}在定义多类深度神经网络的损失函数中可以发挥的作用,其中θθ\mathbf{θ}对应于网络的可训练参数(例如θ={W,b})θ={W,b})\mathbf{θ} = \{\mathbf{W}, \mathbf{b}\} ),观察值是输入激活对xx\mathbf{x}和相应的正确类标签y∈[1,k]y∈[1,k]y \in …

3
ACF和PACF如何识别MA和AR术语的顺序?
我从事不同的时间序列已经超过2年了。我读过许多文章,其中ACF用于标识MA术语的顺序,而PACF用于标识AR。有一条经验法则,对于MA,ACF突然关闭的延迟是MA的顺序,对于PACF和AR同样。 这是我从PennState Eberly College of Science所读的文章之一。 我的问题是为什么呢?对我来说,甚至ACF都可以赋予AR术语。我需要上述拇指法则的解释。我无法直观/数学地理解拇指法则,为什么- 通常,最好使用PACF来识别AR模型。 通常,最好使用ACF而非PACF来完成MA模型的识别 请注意:-我不需要,但是“为什么”。:)


2
使用lm()时R中权重参数背后的理论
在读研究生一年后,我的“加权最小二乘”的理解是这样的:让y∈Rny∈Rn\mathbf{y} \in \mathbb{R}^n,XX\mathbf{X}是一些n×pn×pn \times p设计矩阵,是一个参数向量中的是误差向量,使得,其中和。然后模型 β∈Rpβ∈Rp\boldsymbol\beta \in \mathbb{R}^pϵ∈Rnϵ∈Rn\boldsymbol\epsilon \in \mathbb{R}^nϵ∼N(0,σ2V)ϵ∼N(0,σ2V)\boldsymbol\epsilon \sim \mathcal{N}(\mathbf{0}, \sigma^2\mathbf{V})V=diag(v1,v2,…,vn)V=diag(v1,v2,…,vn)\mathbf{V} = \text{diag}(v_1, v_2, \dots, v_n)σ2>0σ2>0\sigma^2 > 0y=Xβ+ϵy=Xβ+ϵ\mathbf{y} = \mathbf{X}\boldsymbol\beta + \boldsymbol\epsilon 在该假设下的模型称为“加权最小二乘”模型。WLS问题最终是找到 argminβ(y−Xβ)TV−1(y−Xβ).arg⁡minβ(y−Xβ)TV−1(y−Xβ).\begin{equation} \arg\min_{\boldsymbol \beta}\left(\mathbf{y}-\mathbf{X}\boldsymbol\beta\right)^{T}\mathbf{V}^{-1}\left(\mathbf{y}-\mathbf{X}\boldsymbol\beta\right)\text{.} \end{equation} 假设y=[y1…yn]Ty=[y1…yn]T\mathbf{y} = \begin{bmatrix} y_1 & \dots & y_n\end{bmatrix}^{T},β=[β1…βp]Tβ=[β1…βp]T\boldsymbol\beta = \begin{bmatrix} \beta_1 & \dots & \beta_p\end{bmatrix}^{T}和 X=⎡⎣⎢⎢⎢⎢⎢x11x21⋮xn1⋯⋯⋮⋯x1px2p⋮xnp⎤⎦⎥⎥⎥⎥⎥=⎡⎣⎢⎢⎢⎢⎢xT1xT2⋮xTn⎤⎦⎥⎥⎥⎥⎥.X=[x11⋯x1px21⋯x2p⋮⋮⋮xn1⋯xnp]=[x1Tx2T⋮xnT].\mathbf{X} = \begin{bmatrix} x_{11} & \cdots …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.