统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
伽玛和卡方分布之间的关系
如果Y=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2其中Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2),即所有XiXiX_i是独立同分布的正态随机变量的零均值与同方差,然后Y∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). 我知道卡方分布是伽马分布的特例,但无法得出随机变量的卡方分布YYY。有什么帮助吗?

1
将数据转换为期望的均值和标准偏差
我正在寻找一种将数据集从当前均值和标准差转换为目标均值和目标标准差的方法。基本上,我想缩小/扩展离散度并将所有数字缩放为均值。 进行两个单独的线性转换是不起作用的,一个用于标准偏差,然后一个用于均值。我应该使用哪种方法? 当我将数据集的平均值调整为0.5且SD调整为0.1667时,是否可以将该解决方案应用于一个示例,该示例将SD.4的数据集中的点1.02和平均值0.88转换?该点的新价值是什么?

3
使用归一化梯度和梯度的区别
在梯度下降算法的常规设置中,我们有,其中是当前点,是步长,是梯度在评估。 xn+1=xn−η∗gradientxnxn+1=xn−η∗gradientxnx_{n+1} = x_{n} - \eta * gradient_{x_n}xnxnx_nηη\etagradientxngradientxngradient_{x_n}xnxnx_n 我已经在某种算法中看到,人们使用归一化梯度而不是gradient。我想知道使用归一化渐变和简单渐变有什么区别。


1
洛格洛斯vs基尼/奥克
我已经训练了两个模型(使用h2o AutoML的二进制分类器),我想选择一个模型。我得到以下结果: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 的auc和logloss列是交叉验证指标(交叉验证仅使用训练数据)。在..._train和..._valid指标分别由通过模型运行训练和验证指标发现。我想使用logloss_valid或gini_valid选择最佳模型。 模型1具有更好的基尼系数(即更好的AUC),而模型2具有更好的对数损失。我的问题是选择哪一个我认为是问题,使用基尼(AUC)或对数损失作为决策指标的优点/缺点是什么?


2
为什么scikit-learn引导程序功能会对测试集重新采样?
当使用自举进行模型评估时,我一直认为直接购买的样本可以直接用作测试集。但是,对于已弃用的 scikit-learnBootstrap方法来说似乎不是这种情况,该方法似乎是通过从图纸中提取测试数据来构建测试集,并替换了现成的数据子集。这背后的统计原因是什么?在某些特定情况下,该技术比仅对袋外样本进行评估更好,反之亦然吗?

4
如何生成随机分类数据?
假设我有一个类别变量,该变量可以取值A,B,C和D。如何生成10000个随机数据点并控制每个数据点的频率?例如: A = 10%B = 20%C = 65%D = 5% 有什么想法可以做到这一点吗?

2
影响功能和OLS
我试图了解影响功能是如何工作的。有人可以在简单的OLS回归中解释吗 yi=α+β⋅xi+εiÿ一世=α+β⋅X一世+ε一世\begin{equation} y_i = \alpha + \beta \cdot x_i + \varepsilon_i \end{equation} 在这里我想影响作用的ββ\beta。

1
机器学习模型的“能力”是什么?
我正在研究Carl Doersch撰写的有关变式自动编码器的教程。在第二页中指出: 此类框架中最受欢迎的框架之一是本教程的主题“变体自动编码器” [1,3]。该模型的假设很弱,并且通过反向传播训练很快。VAE确实可以近似,但是在给定大容量模型的情况下,这种近似引入的误差可以说很小。这些特征促使它们迅速普及。 过去,我已经阅读了有关大容量模型的这类说法,但似乎没有找到明确的定义。我也发现了这个相关的stackoverflow问题,但对我来说,答案非常不令人满意。 是否有模型容量的定义?你能衡量吗?

2
最大平均差异(距离分布)
我有两个数据集(源数据和目标数据),它们遵循不同的分布。我正在使用MMD(这是一种非参数的距离分布)来计算源数据和目标数据之间的边际分布。 源数据,Xs 目标数据,Xt 适应矩阵A *投影数据,Zs = A'* Xs和Zt = A'Xt * MMD =>距离(P(Xs),P(Xt))= | 平均值(A'Xs)-平均值(A'Xt )| 这意味着:原始空间中源数据和目标数据之间的分布距离等于嵌入式空间中投影源数据和目标数据的均值之间的距离。 我对MMD的概念有疑问。 在MMD公式中,为什么可以通过计算潜在空间中的距离来测量原始空间中的分布距离? 谢谢

1
RNN:什么时候应用BPTT和/或更新权重?
我正在尝试通过Graves于2005年发表的有关音素分类的论文来理解RNN在序列标记上的高级应用。 总结问题:我们有一个庞大的训练集,包括(输入)单个句子的音频文件和(输出)专家标记的各个音素的开始时间,停止时间和标签(包括一些“特殊”音素,例如静默,以便每个音频文件中的每个样本都标有一些音素符号。) 本文的重点是在隐藏层中应用带有LSTM存储单元的RNN。(他使用了几种变体和几种其他技术作为比较。为了使事情简单,我目前仅对单向LSTM感兴趣。) 我相信我了解网络的体系结构:对应于10毫秒音频文件窗口的输入层,以音频工作的标准方式进行了预处理;LSTM单元的隐藏层,以及对所有可能的61个电话符号进行一键编码的输出层。 我相信我了解通过LSTM单元的向前通过和向后通过的(复杂但直接)的方程式。它们只是微积分和链式规则。 在几次阅读本文和几篇类似文章之后,我不明白的是何时确切地应用反向传播算法,何时确切地更新神经元中的各种权重。 存在两种可能的方法: 1)逐帧反向传播和更新 Load a sentence. Divide into frames/timesteps. For each frame: - Apply forward step - Determine error function - Apply backpropagation to this frame's error - Update weights accordingly At end of sentence, reset memory load another sentence and continue. 要么, 2)逐句反向传播和更新: Load …
15 lstm  rnn 



4
免费的公共利益数据托管?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4年前关闭。 我在http://data.barrycarter.info/上有许多站点的每小时和每天的温度报告 我鼓励人们下载它,但是在6.6G时,它会占用大量带宽。 是否有免费托管“公共利益”数据的服务? 我知道http://aws.amazon.com/publicdatasets,但是您需要一个Amazon EC2帐户才能访问该数据。
14 dataset 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.