统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
R中用于中断时间序列分析的资源
我对R相当陌生。我尝试阅读时间序列分析,并且已经完成 Shumway和Stoffer的时间序列分析及其应用第3版, Hyndman出色的预测:原理和实践 艾薇儿·科兰(Avril Coghlan)使用R进行时间序列分析 A. Ian McLeod等人的R时间序列分析 Marcel Dettling博士的应用时间序列分析 编辑:我不确定如何处理此问题,但我发现了交叉验证之外的有用资源。我想把它包括在这里,以防有人偶然发现这个问题。 药物使用研究中中断时间序列研究的分段回归分析 我有一个连续7年每天测量的消耗项目数(计数数据)的单变量时间序列。大约在时间序列的中间对研究人群进行了干预。预计这种干预不会立即产生效果,而且效果发生的时间基本上是不可知的。 使用Hyndman的forecast软件包,我使用来将ARIMA模型拟合到干预前的数据auto.arima()。但是我不确定如何使用这种拟合来回答趋势是否存在统计上显着的变化并量化数量。 # for simplification I will aggregate to monthly counts # I can later generalize any teachings the community supplies count <- c(2464, 2683, 2426, 2258, 1950, 1548, 1108, 991, 1616, 1809, 1688, 2168, 2226, 2379, 2211, …
12 r  time-series 

2
用二次规划优化支持向量机
我正在尝试了解训练线性支持向量机的过程。我意识到,与使用二次编程求解器相比,SMV的属性可以更快地对其进行优化,但是出于学习目的,我希望了解其工作原理。 训练数据 set.seed(2015) df <- data.frame(X1=c(rnorm(5), rnorm(5)+5), X2=c(rnorm(5), rnorm(5)+3), Y=c(rep(1,5), rep(-1, 5))) df X1 X2 Y 1 -1.5454484 0.50127 1 2 -0.5283932 -0.80316 1 3 -1.0867588 0.63644 1 4 -0.0001115 1.14290 1 5 0.3889538 0.06119 1 6 5.5326313 3.68034 -1 7 3.1624283 2.71982 -1 8 5.6505985 3.18633 -1 9 4.3757546 …
12 r  svm  optimization 

3
卷积神经网络中最终Softmax层之前的非线性
我正在研究并尝试实现卷积神经网络,但是我想这个问题通常适用于多层感知器。 我网络中的输出神经元代表每个类别的激活:最活跃的神经元对应于给定输入的预测类别。为了考虑训练的交叉熵成本,我在网络的末端添加了softmax层,以便将每个神经元的激活值解释为概率值。 我的问题是:输出层中的神经元是否应该对输入应用非线性函数?我的直觉是没有必要: 如果第一世一世i个输出神经元的输入是向量(来自上一层)与该神经元权重之间的点积, X θ 我XŤθ一世XŤθ一世x^T\theta_iXXxθ一世θ一世\theta_i 如果我采用单调非线性函数(如S型或ReLU) 那么较大的激活输出仍将对应于最大,因此从这个角度来看,非线性函数不会改变预测。XŤθ一世XŤθ一世x^T\theta_i 这种解释有问题吗?我是否忽略了一些训练因素,这些因素使输出非线性成为必要? 如果我是对的,那么如果不是使用Sigmoid函数而是使用ReLU函数(不是严格单调的函数,会发生什么变化吗?最大值(0 ,XŤθ一世)最大值(0,XŤθ一世)\max(0,x^T\theta_i) 编辑 关于Karel的答案,其答案主要是“取决于”,这是对我的网络和疑问的更详细描述: 假设我有N个隐藏层,而我的输出层只是代表类的一组神经元上的softmax层(所以我的预期输出是输入数据属于每个类的概率)。假设第一个N-1层具有非线性神经元,那么在第N个隐藏层中使用非线性与线性神经元有什么区别?

3
如何使用glmnet以收缩(套索)方法处理NA值
我在GWAS中使用“ glmnet”进行套索回归。某些变体和个人缺少值,并且glmnet似乎无法处理丢失的值。 有什么解决办法吗?还是有其他软件包可以处理套索回归中的缺失值? 这是我的脚本。 > library(glmnet) > geno6<-read.table("c6sigCnt.geno") > geno6[1:10,1:10] #genotype file (0,1,2 for minor allele counts) V1 V2 V3 V4 V5 V6 V7 V8 V9 V10 1 1 1 1 1 1 1 1 1 1 0 2 NA NA 1 1 1 1 1 1 1 1 3 …


1
平均平均精度与平均倒数排名
我试图了解何时适合使用MAP以及何时应使用MRR。我发现此演示文稿指出,当相关结果的数量小于5时,使用MRR最佳,而当结果为1时,则使用MRR最佳。在其他情况下,MAP适用。我有两个问题: 我真的不明白为什么会这样。 我找不到此主张的引证依据。 请注意,我没有很强的统计背景,所以外行的解释会很有帮助。谢谢。


2
glmnet包中的偏差度量的确切定义,是否具有交叉验证?
对于当前的研究,我通过二项式因变量通过R中的glmnet包使用Lasso方法。 在glmnet中,可以通过交叉验证找到最佳的lambda,并将生成的模型与各种度量进行比较,例如分类错误或偏差。 我的问题:glmnet中的偏差有多准确?如何计算? (在Friedman等人的相应论文“通过坐标下降的广义线性模型的正则化路径”中,我仅对cv.glmnet中使用的偏差发现了这一评论:“平均偏差(减去左侧的对数似然的两倍数据)”(第17页))。

3
如何处理不存在或缺失的数据?
我尝试了一种预测方法,并想检查我的方法是否正确。 我的研究正在比较不同种类的共同基金。我想使用GCC指数作为其中一个的基准,但问题是GCC指数于2011年9月停止,我的研究时间是2003年1月至2014年7月。因此,我尝试使用另一个指数MSCI指数,进行线性回归,但问题在于MSCI指数缺少2010年9月以来的数据。 为了解决这个问题,我做了以下工作。这些步骤有效吗? MSCI指数缺少2010年9月到2012年7月的数据。我通过应用五个观察值的移动平均值来“提供”该数据。这种方法有效吗?如果是这样,我应该使用多少个观测值? 在估计了缺失的数据之后,我对相互可用期间(从2007年1月到2011年9月)的GCC指数(作为因变量)与MSCI指数(作为自变量)进行了回归,然后针对所有问题对模型进行了校正。对于每个月,我将其余时间段的x替换为MSCI索引中的数据。这有效吗? 以下是逗号分隔值格式的数据,其中包含按行的年和按列的月。也可以通过此链接获得数据 。 系列GCC: ,Jan,Feb,Mar,Apr,May,Jun,Jul,Aug,Sep,Oct,Nov,Dec 2002,NA,NA,NA,NA,NA,NA,NA,NA,NA,NA,NA,117.709 2003,120.176,117.983,120.913,134.036,145.829,143.108,149.712,156.997,162.158,158.526,166.42,180.306 2004,185.367,185.604,200.433,218.923,226.493,230.492,249.953,262.295,275.088,295.005,328.197,336.817 2005,346.721,363.919,423.232,492.508,519.074,605.804,581.975,676.021,692.077,761.837,863.65,844.865 2006,947.402,993.004,909.894,732.646,598.877,686.258,634.835,658.295,672.233,677.234,491.163,488.911 2007,440.237,486.828,456.164,452.141,495.19,473.926,492.782,525.295,519.081,575.744,599.984,668.192 2008,626.203,681.292,616.841,676.242,657.467,654.66,635.478,603.639,527.326,396.904,338.696,308.085 2009,279.706,252.054,272.082,314.367,340.354,325.99,326.46,327.053,354.192,339.035,329.668,318.267 2010,309.847,321.98,345.594,335.045,311.363,299.555,310.802,306.523,315.496,324.153,323.256,334.802 2011,331.133,311.292,323.08,327.105,320.258,312.749,305.073,297.087,298.671,NA,NA,NA 系列MSCI: ,Jan,Feb,Mar,Apr,May,Jun,Jul,Aug,Sep,Oct,Nov,Dec 2007,NA,NA,NA,NA,1000,958.645,1016.085,1049.468,1033.775,1118.854,1142.347,1298.223 2008,1197.656,1282.557,1164.874,1248.42,1227.061,1221.049,1161.246,1112.582,929.379,680.086,516.511,521.127 2009,487.562,450.331,478.255,560.667,605.143,598.611,609.559,615.73,662.891,655.639,628.404,602.14 2010,601.1,622.624,661.875,644.751,588.526,587.4,615.008,606.133,NA,NA,NA,NA 2011,NA,NA,NA,NA,NA,NA,NA,NA,NA,NA,NA,NA 2012,NA,NA,NA,NA,NA,NA,NA,609.51,598.428,595.622,582.905,599.447 2013,627.561,619.581,636.284,632.099,651.995,651.39,687.194,676.76,694.575,704.806,727.625,739.842 2014,759.036,787.057,817.067,824.313,857.055,805.31,873.619,NA,NA,NA,NA,NA

3
每门Coursera机器学习课程的正则化线性回归成本函数的推导
几个月前,我通过Coursera上了Andrew Ng的课程“机器学习”,没有关注大多数的数学/派生,而是专注于实现和实用性。从那时起,我开始回头研究一些基础理论,并重新审视了吴教授的一些演讲。我正在阅读他关于“正则化线性回归”的演讲,发现他给出了以下成本函数: Ĵ(θ )= 12 米[ ∑我= 1米(小时θ(x(我))- ÿ(我))2+ λ Σj = 1ñθ2Ĵ]J(θ)=12m[∑i=1m(hθ(x(i))−y(i))2+λ∑j=1nθj2]J(\theta) = \frac{1}{2m}[\sum_{i=1}^m(h_\theta (x^{(i)}) - y^{(i)})^2 + \lambda\sum_{j=1}^n\theta^2_j] 然后,他为此成本函数给出了以下梯度: ∂∂θĴĴ(θ )= 1米[ ∑我= 1米(小时θ(x(我))- ÿ(我))x(我)Ĵ- λ θĴ]∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))−y(i))xj(i)−λθj]\frac{\partial}{\partial \theta_j}J(\theta) = \frac{1}{m}[\sum_{i=1}^m(h_\theta (x^{(i)}) - y^{(i)})x^{(i)}_j - \lambda\theta_j] 我对他如何从一个人到另一个人感到困惑。当我尝试进行自己的推导时,结果如下: ∂∂θĴĴ(θ )= 1米[ ∑我= 1米(小时θ(x(我))+ y(我))x(我)Ĵ+ λ θĴ]∂∂θjJ(θ)=1m[∑i=1m(hθ(x(i))+y(i))xj(i)+λθj]\frac{\partial}{\partial \theta_j}J(\theta) = \frac{1}{m}[\sum_{i=1}^m(h_\theta (x^{(i)}) …


1
在聚类分析中为变量分配权重
我想在聚类分析中为变量分配不同的权重,但是我的程序(Stata)似乎对此没有选择,所以我需要手动进行操作。 想象一下4个变量A,B,C,D。这些变量的权重应为 w(A)=50% w(B)=25% w(C)=10% w(D)=15% 我想知道以下两种方法之一是否真的可以解决问题: 首先,我将所有变量标准化(例如,按其范围)。然后,我将每个标准化变量与其权重相乘。然后进行聚类分析。 我将所有变量与其权重相乘,然后对其进行标准化。然后进行聚类分析。 还是两个想法都是完全废话? [编辑] 我希望使用的聚类算法(我尝试了3种不同的算法)是k均值,加权平均链接和平均链接。我计划使用加权平均链接来确定大量簇,然后将它们插入k均值。
12 clustering  stata 

3
极少量检测异常值
给定十二个样本亮度值,我需要获得尽可能精确的主要稳定光源的亮度值。传感器不完美,光线有时会“闪烁”变亮或变暗,可以忽略不计,因此我需要进行异常检测(我认为?)。 我已经在这里阅读了各种方法的一些知识,但无法决定采用哪种方法。离群数事先未知,通常为零。闪烁通常与稳定的亮度有很大的偏差(足以与当前存在的平均值相混淆),但不一定如此。 以下是12个测量值的示例集合,以确保问题的完整性: 295.5214、277.7749、274.6538、272.5897、271.0733、292.5856、282.0986、275.0419、273.084、273.1783、274.0317、290.1837 我的直觉是,尽管292和295看起来有点高,但在特定的集合中可能没有异常值。 因此,我的问题是,这里最好的方法是什么?我应该提到的是,这些值是从零(黑色)点取光的RG和B分量的欧几里得距离得出的。如果需要,返回到这些值在程序上会很痛苦,但有可能。欧几里德距离被用作“整体强度”的量度,因为我对颜色不感兴趣,而对输出强度不感兴趣。但是,我提到的闪烁有一个合理的机会与通常的输出具有不同的RGB组成。 目前,我正在玩某种功能,该功能会重复执行,直到通过以下方式达到允许的措施的稳定成员身份为止: 求标准偏差 将外面的所有内容说2个SD放入忽略列表 重新计算平均值和标准差(不包括忽略列表) 根据新的平均值和SD重新确定要忽略的人(评估所有12个) 重复直到稳定。 这种方法有什么价值? 感谢所有评论!

2
(非二项式)名义变量与数值(区间)或序数变量之间的相关系数
我已经阅读了本网站的所有页面,试图找到解决我问题的方法,但是似乎没有人适合我。 首先,我向您解释我正在使用的数据类型... 假设我有一个包含多个城市名称的数组矢量,每300个用户一个。我还有另一个数组向量,其分数响应每个用户的调查或每个用户的连续值。 我想知道是否存在相关系数来计算这两个变量之间的相关性,因此可以计算名义变量与数字/连续或有序变量之间的相关性。 我在互联网上搜索过,在某些页面中,他们建议使用权变系数或Cramer的V或Lambda系数或Eta。只需说一说,就可以将它们应用于具有标称变量和区间或数值变量的此类数据。事实是,如果您有二等标称变量(除了Cramer's V之外),那么有时会写一些或试图理解它们,尝试理解它们的示例或观看它们合理地使用它们的示例,而其他时间则没有写任何要求数据类型。许多其他页面都说应用回归是正确的,那是正确的,但是我只是想知道是否存在像这类数据的皮尔森/皮尔曼系数。 我还认为使用Spearman Correlation coeff不太合适,因为这些城市无法分类。 我还自己建立了Cramer'sV和Eta的函数(我正在与Matlab一起工作),但对于Eta,他们不会谈论任何p值以查看系数是否在统计上显着... 在matlabWorks网站上,还有一个不错的工具箱,用于计算eta ^ 2,但所需的输入类型却无法理解。 这里有人做过像我这样的测试吗?如果您需要更多详细信息以了解我使用的数据类型,请问我,我会尽力向您解释。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.