统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
您如何计算
如果是指数分布(我= 1 ,。。。,Ñ )具有参数λ和X 我的是相互独立的,什么是期望X一世XiX_i(我= 1 ,。。。,Ñ )(i=1,...,n)(i=1,...,n)λλ\lambdaX一世XiX_i (∑我= 1ñX一世)2(∑i=1nXi)2 \left(\sum_{i=1}^n {X_i} \right)^2 根据和λ以及其他常数?ñnnλλ\lambda 注意:这个问题已经在/math//q/12068/4051上获得了数学答案。读者也可以看看。


3
如何使用CDF和PDF统计信息进行分析
这可能是一个笼统的问题,但我希望可以在这里找到帮助。我正在大学里从事RA工作,并且我的主题与Internet流量分析有关。我对分析界还很陌生,但是我想在研究界这是我必须做的很多事情。 我浏览了几篇论文,在很多论文中,我发现他们使用概率密度(PDF),CDF,CCDF等来解释他们获得的结果。例如,用户会话持续时间的PDF,每天传输的字节的CDF等。我参加了概率统计课,所以我了解它们是什么,但我仍然对选择这种表示形式的情况感到困惑。 因此,如果有人在进行此类图表和分析(在其他任何一般主题或其他主题中),您能简单地告诉我在什么情况下使用其中一种表示形式

5
逻辑回归中更好的默认分类
全面披露:这是家庭作业。我提供了指向数据集的链接(http://www.bertelsen.ca/R/logistic-regression.sav) 我的目标是在此数据集中最大程度地预测违约贷款。 到目前为止,我提出的每个模型都预测> 90%的非默认者,但是<40%的默认者使分类效率总体达到80%。那么,我想知道变量之间是否存在交互作用?在逻辑回归中,除了测试每种可能的组合之外,还有没有办法确定潜在的交互作用?或者,一种提高违约者分类效率的方法。 我被困住了,任何建议都会对您选择单词,R代码或SPSS语法有所帮助。 下面的直方图和散点图概述了我的主要变量(二分变量除外) 主要变量的说明: age: Age in years employ: Years with current employer address: Years at current address income: Household income in thousands debtinc: Debt to income ratio (x100) creddebt: Credit card debt in thousands othdebt: Other debt in thousands default: Previously defaulted (dichotomous, yes/no, 0/1) ed: …
12 r  logistic  spss  self-study 

1
用新观察值更新套索拟合
我正在将L1正则化线性回归拟合到一个非常大的数据集(具有n >> p。)中,变量是预先已知的,但观察结果却很小。我想在每个块之后保持套索适合。 在看到每组新的观察结果之后,我显然可以重新拟合整个模型。但是,鉴于有大量数据,这将是非常低效的。到达每个步骤的新数据量非常小,并且拟合之间不太可能在步骤之间变化很大。 我有什么办法可以减少总体计算负担? 我一直在研究Efron等人的LARS算法,但是如果可以按照上述方式进行“热启动”,那么很高兴考虑其他任何拟合方法。 笔记: 我主要是在寻找一种算法,但是指向可以做到这一点的现有软件包的指针也可能很有见地。 除了当前的套索轨迹外,当然欢迎该算法保持其他状态。 布拉德利·埃夫隆(Bradley Efron),特雷弗·哈斯提(Trevor Hastie),伊恩·约翰斯通(Iain Johnstone)和罗伯特·蒂布舍拉尼(Robert Tibshirani),《 最小角度回归》,《统计年鉴》(含讨论)(2004)32(2),407--499。
12 regression  lasso 

3
验证问卷
我正在为我的论文设计问卷。我正在验证问卷的过程中,已将Cronbach's alpha检验应用于初始样本组。对问卷的回答是李克特量表;任何人都可以建议任何进一步的测试来帮助测试其有效性。我不是统计学专家,所以我们将不胜感激。 我一直在做一些研究,似乎可以进行Rasch分析了,有没有人有免费的软件站点可以应用此测试和建议?

2
R新手的项目分析
我正在尝试评估20个多项选择测试。我想执行一个项目分析,例如在本示例中可以找到的。因此,对于每个问题,我都希望P值以及与总数的相关性以及所选选项的分布。 我对那里的各种统计软件包一无所知,但是我想使用R,因为我对编程很满意并且R是开源的。我设想的伪工作流程是: 在Excel中准备数据并导出为CSV 将数据加载到R中 加载符合我需要的软件包 执行该软件包的命令 导出并报告。 我对1和2充满信心,但对3却有疑问,可能是因为我没有统计词汇来比较我在CRAN上浏览的软件包。 ltm看起来它可能是正确的软件包,但我不知道。无论使用什么软件包,命令将是什么? 附带问题:在链接的示例中,您认为MC和MI代表什么?

2
如何参数化两个正态分布变量的比率或一个的倒数?
问题: 我正在参数化分布,以用作贝叶斯元分析中的先验和数据。数据在文献中以摘要统计的形式提供,几乎专门假定为正态分布(尽管所有变量均不能小于0,某些变量是比率,某些变量是质量,等等)。 我遇到了两种情况,但我没有解决方案。有时感兴趣的参数是数据的倒数或两个变量的比率。 例子: 两个正态分布变量的比率: 数据:氮和碳百分比的平均值和标准偏差 参数:碳氮比。 正态分布变量的倒数: 数据:质量/面积 参数:面积/质量 我当前的方法是使用仿真: 例如,对于一组碳和氮百分比数据,均值:xbar.n,c,方差:se.n,c,样本大小:nn,nc: set.seed(1) per.c <- rnorm(100000, xbar.c, se.c*n.c) # percent C per.n <- rnorm(100000, xbar.n, se.n*n.n) # percent N 我想参数化ratio.cn = perc.c / perc.n # parameter of interest ratio.cn <- perc.c / perc.n 然后为我的先前选择范围为的最佳拟合分布0 → ∞0→∞0 \rightarrow \infty library(MASS) dist.fig …

3
自适应核密度估计器?
谁能用自适应核密度估计器报告其经验? (有很多同义词:自适应|变量|可变宽度,KDE |直方图|插值器...) 可变核密度估计 表示“我们在样本空间的不同区域中改变核的宽度。有两种方法……”实际上更多:更多是在一定半径范围内的邻居,KNN最近邻居(通常是K),Kd树,多重网格... 当然,没有任何一种方法可以做所有事情,但是自适应方法看起来很有吸引力。 例如,参见有限元方法中的自适应2d网格的精美图片 。 我想听听对实际数据有效的/无效的,特别是在2d或3d中> = 100k分散的数据点。 添加11月2日:这是一个“笨拙的”密度(逐段x ^ 2 * y ^ 2),最近邻估计以及高斯KDE与Scott因子的关系图。虽然一(1)个示例没有证明任何内容,但它确实表明NN可以很好地适应陡峭的山丘(并且使用KD树,在2d,3d中速度很快...)

4
如何将迭代加权最小二乘(IRLS)方法应用于LASSO模型?
我已经使用IRLS算法对逻辑回归进行了编程。我想对LASSO进行处罚,以便自动选择正确的功能。在每次迭代中,解决了以下问题: (XTWX)δβ^=XT(y−p)(XTWX)δβ^=XT(y−p)\mathbf{\left(X^TWX\right) \delta\hat\beta=X^T\left(y-p\right)} 令为非负实数。我没有按照《The Elements of》中的建议对拦截进行处罚。统计学习。同为零的系数。否则,我从右边减去一个术语:λλ\lambda XT(y−p)−λ×sign(β^)XT(y−p)−λ×sign(β^)\mathbf{X^T\left(y-p\right)-\lambda\times \mathrm{sign}\left(\hat\beta\right)} 但是,我不确定IRLS算法的修改。这是正确的方法吗? 编辑:尽管我对此并不自信,但这是我最终想出的解决方案之一。有趣的是,此解决方案与我现在对LASSO的了解相对应。实际上,每次迭代有两个步骤,而不仅仅是一个步骤: 第一步与之前相同:我们对该算法进行迭代(就像上面梯度的公式中),λ=0λ=0\lambda=0 第二步是新步骤:我们对第一步获得的向量每个分量(分量,它对应于截距)应用一个软阈值。这称为迭代软阈值算法。 ββ0β0\beta_0ββ\beta ∀i≥1,βi←sign(βi)×max(0,|βi|−λ)∀i≥1,βi←sign(βi)×max(0,|βi|−λ)\forall i \geq 1, \beta_{i}\leftarrow\mathrm{sign}\left(\beta_{i}\right)\times\max\left(0,\,\left|\beta_{i}\right|-\lambda\right)

2
参数样本量计算和非参数分析
我很好奇,是否有人有特定的参考文献(文本或期刊文章)来支持医学文献中使用参数化方法(例如,假设正态分布和测量值有一定差异)执行样本量计算的惯例。当使用非参数方法进行主要试验结果的分析时。 例如:主要结果是服用某种药物后的呕吐时间,已知其平均值为20分钟(标准差为6分钟),但分布明显偏右。样本数量的计算是使用公式根据上面列出的假设进行的 n (每组)= f(α ,β)× (2 σ2/( μ1个- μ2)2)n(per-group)=f(α,β)×(2σ2/(μ1−μ2)2)n(\text{per-group})=f(\alpha,\beta) \times (2\sigma^2 /(\mu_1 - \mu_2)^2 ), 哪里 F(α ,β)f(α,β)f(\alpha, \beta) 根据所需的变化 αα\alpha 和 ββ\beta 错误。 但是,由于分布的偏斜性,主要结果的分析将基于等级(非参数方法,例如Mann Whitney U检验)。 统计学家是否可以支持这种模式,还是应该进行非参数的样本量估算(以及如何进行估算)? 我的想法是,为了便于计算,可以进行上述练习。毕竟,样本量估算值仅仅是(已经做出了多个假设的估算值)所有这些估算值可能都略微(或非常不精确)。但是,我很想知道其他人的想法,特别是想知道是否有任何引用来支持这种推理方法。 非常感谢您的协助。



3
你能解释为什么当
我需要帮助解释并引用基本的统计文本,论文或其他参考文献,为什么使用在轮询中报告的误差幅度(MOE)统计信息通常天真地不正确地声明统计联系是不正确的。 一个示例:在轮询候选人A引线候选人B,%的,4.5 %容限的误差为500名调查选民。39−3139−3139 - 314.5%4.5%4.5 \%500500500 我朋友的原因是这样的: 由于统计建模的复杂性,误差范围意味着A的真实支持率可能低至34.5%,B的真实支持率可能高达35.5%。因此,A和B实际上处于统计死角。 在清楚阐明我朋友的推理缺陷方面,所有帮助都值得赞赏。我试图解释,如果,天真地拒绝假设“ A Leads B”是不正确的。 pA−pB&lt;2MOEpA−pB&lt;2MOEp_A-p_B < 2MOE
12 polling 

3
处理不完整/丢失数据的技术
我的问题是针对在分类器/模型训练/拟合期间处理不完整数据的技术。 例如,在一个有几百行的数据集中,每行有五个维度和一个类标签作为最后一项,大多数数据点看起来像这样: [0.74、0.39、0.14、0.33、0.34、0] 一些可能看起来像这样: [0.21、0.68,?,0.82、0.58、1] 因此,正是这些数据点类型成为了本课题的重点。 我问这个问题的最初原因是我面前的一个问题。但是,在发布我的问题之前,我认为如果我重新措辞可能会更有用,因此答案对于社区的更大一部分将很有用。 作为一种简单的启发式方法,让我们根据在处理流程中使用数据的时间(在输入到分类器之前或期间)对这些数据处理技术进行划分(即,该技术位于分类器内部)。 我可以为后者想到的最好的例子是决策树中使用的巧妙的“三向分支”技术。 毫无疑问,前者的范围更大。我知道的所有技术都属于以下组之一。 最近,当我查看有关“缺少数据处理”的个人笔记时,我注意到我掌握了许多令人印象深刻的技术。我只是保留这些注释,以使一般人安心,以防万一初级同事问我如何处理丢失的数据。在实际实践中,除了最后一个,我实际上没有使用任何一个。 归因(imputation):这套技术的广泛适用范围,其共同点(我相信)是,缺失的数据直接由同一数据集提供-替代而不是估计/预测。 重构:使用自动关联网络(只是输入和输出层大小相等的神经网络,换句话说,输出与输入具有相同的维度)来估计丢失的数据点;这里的想法是在完整的数据上训练该网络,然后为它提供不完整的模式,并从输出节点读取缺少的值。 引导程序:(鉴于统计分析中的其他用途,因此我不认为没有摘要是必要的)。 拒绝:从训练集中悄悄删除缺少/损坏元素的数据点,并假装它们不存在。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.