统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何仅通过5到7个数据点来估计逻辑回归的上限?
我有。对于到的估计,我使用本文的公式:John非线性回归和非线性最小二乘法 在本文中,通过查看数据来估计。如果我这样做,即使我只有三点,它也能正常工作。由此我可以计算出另外两个。我用R中的nls()和C#中的LevenbergMarquardt测试了我的参数。他们返回的模型令人满意。 β1β3y=β11+exp(β2+β3∗x)y=β11+exp⁡(β2+β3∗x)y = \frac{\beta_1}{1 + \exp(\beta_2 + \beta_3 * x)}β1β1\beta_1β3β3\beta_3β1β1\beta_1 问题是我不想查看数据来获得的良好估计量,而是希望我的程序对其进行计算。一段时间以来,我使用的值比我的最大值(在\ max * 1.1和\ max * 1.5之间的值)高一点。只要这些点覆盖了函数的大部分,此方法就可以正常工作。数据点位于曲线“顶部”的某个位置,但是当它们全部来自拐点“下方”时,此估计量肯定低于应有的水平,因此我无法拟合模型。绝对高于最高点(通过将其乘以高得离谱的值),模型无法以任何有用的方式拟合。β1β1\beta_1max∗1.1max∗1.1\max * 1.1max∗1.5max∗1.5\max * 1.5 测量可能如下所示: x =(40,50,60,70),y =(1000,950,400,200)->易于估计 x =(40,50,60,70),y =(1000,950,800,100)->易于估计 x =(40,50,60,70),y =(500,200,100,50)->估计起来不太容易 我想我可以通过计算给定点的增量并根据其计算上限来找出我在函数中的位置(在“底部”,在“顶部”,在坡度中)。有没有人暗示有更好的解决方案?附加信息:如果无法完成,对我来说,更重要的一点是,可以拟合的测量结果要尽可能地好,并且我接受某些测量结果根本无法拟合的问题。 (尽管我想要在这里发布的C#实现,但我认为问题不取决于语言) 更新(此应用): x是温度值,y是相应的测量值。从本质上讲,它应该看起来像逻辑曲线,在较低温度下具有较高的y值,反之亦然。熔点等于曲线的拐点,随着模型参数的微小变化,其变化很大。 更新(一些由7个数据点组成的数据,已知拐点为60): //first I made up some data without any noise and enough (13) points …

1
可以将这些数据汇总成二项式glm的比例吗?
我们要求60个人列出尽可能多的亚特兰大饭店特许经营权。总体列表中包括70多家餐厅,但我们淘汰了不到10%的人提到的餐厅,剩下45家。对于这45家餐厅,我们计算了列出特许经营权的线人的比例,并且我们对根据特许经营权(对数转换)的广告预算和自成为特许经营权以来的年限来建模此比例。 所以我写了这段代码: model <- glm ( cbind (listed, 55-listed) ~ log.budget + years, family = binomial, data = list.45) 正如预测的那样,这两个变量都显示出强大而显着的效果。 但是,即使我知道绝对不应该使用OLS回归对比例数据建模,但我随后编写了以下代码: model.lm <- lm ( proportion.55 ~ log.budget + years, data = list.45) 在这种情况下,“预算”仍然是重要的预测指标,但“年”相对较弱,并不重要。 这让我担心,对估计的信心会因汇总而被人为夸大。二项式glm实际上不是对数据进行矢量化处理,从而使模型基于45 * 55 = 2,475行吗?考虑到实际上只有45家餐厅和55名线人,这是否合适?这是否需要混合效果建模?

5
关于文本挖掘的好书?
嗨,我想知道是否有一些有关文本挖掘和分类的好书,还有一些案例研究?如果不是这样的话,一些公众可以获取的论文/期刊就可以了。如果他们用R更好地说明自己的例子。我不是在寻找逐步的手册,而是要说明一些针对各种问题的各种文本挖掘方法的利弊。

1
我可以为该样本假设(对数)正态吗?
这是我的样品的QQ图(注意对数Y轴);:n=1000n=1000n = 1000 正如whuber所指出的,这表明基础分布是左偏斜的(右尾较短)。 使用R中的shapiro.test(对数转换后的数据),我得到的检验统计和的p值,这意味着我们正式拒绝了零假设在95%置信水平下的。5.172 ⋅ 10 - 13W=0.9718W=0.9718W = 0.97185.172⋅10−135.172⋅10−135.172\cdot10^{-13}H0:the sample is normal distributedH0:the sample is normal distributedH_0 : \text{the sample is normal distributed} 我的问题是:在实践中,假设(对数)正态性是否足够用于进一步分析?特别是,我想使用Cox和Land的近似方法计算相似样本均值的置信区间(在论文中进行描述:Zou,GY,cindy Yan Huo和Taleban,J.(2009)。对数正态平均值及其与环境应用的差异(环境计量学20,172–180): ci <- function (x) { y <- log(x) n <- length(y) s2 <- var(y) m <- mean(y) + s2 / 2 z …

4
试图在StackOverflow信誉分布上计算Gini指数?
我正在尝试使用SO Data Explorer在SO信誉分布上计算基尼系数。我要实现的方程式是: 其中: =网站上的用户数; =用户序列号(1-225,000); =用户信誉。niyi我ģ (小号)= 1n − 1( Ñ + 1 - 2 (Σñ我= 1(n + 1 - i )y一世∑ñ我= 1ÿ一世))G(S)=1n−1(n+1−2(∑i=1n(n+1−i)yi∑i=1nyi)) G(S)=\frac{1}{n-1}\left(n+1-2\left(\frac{\sum^n_{i=1}(n+1-i)y_i}{\sum^n_{i=1}y_i}\right)\right) ñnn一世iiÿ一世yiy_i一世ii 这就是我的实现方式(从此处复制): DECLARE @numUsers int SELECT @numUsers = COUNT(*) FROM Users DECLARE @totalRep float SELECT @totalRep = SUM(Users.Reputation) FROM Users DECLARE @giniNominator float SELECT @giniNominator …
11 gini 

1
在R中没有比例赔率假设的情况下,如何在序数逻辑回归中固定系数?
我想在R中进行序数逻辑回归,而没有比例赔率假设。我知道可以通过设置vglm()功能直接完成此操作。Rparallel=FALSE 但是我的问题是如何在此回归设置中固定一组特定的系数?例如,假设因变量是离散的和有序和可以取的值,,或3。如果回归变量为X_ {1}和X_ {2},则回归方程为ÿÿYÿ= 1ÿ=1个Y = 1222333X1个X1个X_{1}X2X2X_{2} 升ø 克我吨( P(是≤ 1 ))升ø 克我吨( P(是≤ 2 ))= α1个+ β11X1个+ β12X2= α2+ β21X1个+ β22X2升ØG一世Ť(P(ÿ≤1个))=α1个+β11X1个+β12X2升ØG一世Ť(P(ÿ≤2))=α2+β21X1个+β22X2 \begin{aligned} {\rm logit} \big( P(Y \leq 1) \big) &= \alpha_{1} + \beta_{11}X_{1} + \beta_{12}X_{2} \\ {\rm logit}\big(P(Y \leq 2) \big) &= \alpha_{2} + \beta_{21}X_{1} + \beta_{22}X_{2} \end{aligned} 我想将和为。请让我知道如何实现这一目标。另外,如果不能执行此操作,是否还可以让我知道是否可以在任何其他统计软件中实现?β11β11\beta_{11}β22β22\beta_{22}1个1个1R
11 r  regression  logistic 

1
舍恩菲尔德残差
在具有多个变量的Cox比例风险模型中,如果对于这些变量之一,Schoenfeld残差不是平坦的,这是否会使整个模型无效?或者是否可以忽略效果不佳的变量?即,解释其他变量的系数,但不解释性能差的变量的结果系数。 处理Schoenfeld残差不平坦的模型有几种标准方法。暂时假设我们做不到。

3
仿真研究:如何选择迭代次数?
我想使用“模型1”生成数据,并使其与“模型2”匹配。基本思想是研究“模型2”的鲁棒性。我对95%置信区间的覆盖率(基于正常近似值)特别感兴趣。 如何设置迭代次数? 大于必需的复制量是否会导致虚假的偏差,这是真的吗?如果是这样,那怎么办?

2
纯粹数学家的应用概率介绍?
我拥有纯数学(测量理论,泛函分析,算子代数等)的研究生背景。我的工作还需要概率论方面的一些知识(从基本原理到机器学习技术)。 我的问题是:有人可以提供一些规范的阅读和参考资料: 概率论的完备介绍 不要回避度量理论方法和证明 重点强调应用技术。 基本上,我想要一本书,该书将教我面向纯数学家的应用概率论。从概率论的基本公理开始,并以严格的数学方法介绍应用的概念。 根据评论,我将详细说明我需要的东西。我正在进行基础到高级的数据挖掘。Logistic回归,决策树,基本统计和概率(方差,标准差,可能性,概率,可能性等),有监督和无监督的机器学习(主要是聚类(K均值,层次结构,SVM))。 考虑到以上几点,我希望有一本书从头开始。定义概率测度,然后还显示这些测度如何导致基本求和概率(直觉上,我知道是通过离散集的积分发生的)。从那里开始,它可能会进入:贝叶斯(Mares Chains),马尔可夫链(Markov Chains)...。矿业)。 是否有这样的书或参考书? 谢谢! PS-我意识到这在范围上类似于这个问题。但是,我在寻找概率论而不是统计学(就像两个领域一样)。

1
Ridge和LASSO具有协方差结构?
在阅读了《统计学习的要素》(Hastie,Tibshrani和Friedman)的第3章之后,我想知道是否有可能在给定协方差结构的情况下实现此问题标题上引用的著名收缩方法,即最小化(也许更一般) )数量 (y⃗ - Xβ⃗ )ŤV− 1(y⃗ - Xβ⃗ )+ λ ˚F(β),(1 ) (ÿ→-Xβ→)ŤV-1个(ÿ→-Xβ→)+λF(β), (1个)(\vec{y}-X\vec{\beta})^TV^{-1}(\vec{y}-X\vec{\beta})+\lambda f(\beta),\ \ \ (1) 而不是通常的 这主要是由于以下事实:在我的特定应用中,我们对具有不同的方差(有时甚至可以估算出协方差结构),我很乐意将其包括在内他们在回归。我这样做是为了进行岭回归:至少通过在Python / C中实现它,我发现系数追踪的路径存在重要差异,这在比较两种情况下的交叉验证曲线时也很明显。(y⃗ - Xβ⃗ )(y⃗ - Xβ⃗ )+ λ ˚F(β)。(2 ) (ÿ→-Xβ→)(ÿ→-Xβ→)+λF(β)。 (2)(\vec{y}-X\vec{\beta})(\vec{y}-X\vec{\beta})+\lambda f(\beta).\ \ \ \ \ \ \ \ \ \ \ \ (2)ÿ⃗ ÿ→\vec{y} 我现在准备尝试通过最小角度回归来实现LASSO,但是为了做到这一点,我必须首先证明,当最小化而不是时,其所有不错的属性仍然有效。到目前为止,我还没有看到任何能真正完成所有这些工作的工作,但是一段时间前,我还读了一句话,上面写着“ 那些不知道统计数字的人注定要重新发现它 …

2
GLM输出中的色散参数
我已经在R中看到了一点,在summary()输出的底部附近,它指出 (Dispersion parameter for gaussian family taken to be 28.35031) 我在Google上进行了一些摸索,并了解到散度参数用于适应标准误差。我希望有人可以提供更多有关分散参数是什么以及应如何解释的详细信息?



5
置信区间和概率-此语句中的错误在哪里?
如果有人发表如下声明: “总体而言,与不接触烟的非吸烟者相比,接触环境烟的非吸烟者患冠心病的相对风险为1.25(95%置信区间为1.17至1.32)。” 整个人口的相对风险是多少?有多少东西与冠心病有关?在可以测试的大量事物中,实际上很少与冠心病有关,因此,任意选择的任何特定事物与之相连的机会都将大大减少。因此,我们可以说该人群的相对风险为1。但是所引用的间隔不包含值1。因此,或者两者之间确实存在联系,而这两者的可能性正在逐渐减小,或者这是其中之一。不包含参数的间隔的5%。由于后者比前者更有可能是我们应该假设的。因此,适当的结论是,该数据集几乎可以肯定是该人群的非典型数据, 当然,如果有某种依据可以假定超过5%的疾病与冠心病有关,那么统计中可能会有一些证据支持环境烟雾就是其中之一的说法。常识表明这不太可能。 他们的推理有什么错误(因为所有卫生组织都同意,有大量有关二手烟破坏作用的文献)?是因为他们的前提是“在可以测试的大量事物中,实际上很少与冠心病有关”?这句话对于任何随机选择的因素(例如,一个人拥有几只患有冠状动脉疾病的狗)可能都是正确的,但二手烟和冠心病的先验概率要比“任何随机因素”高得多。 这是正确的推理吗?还是还有别的东西?

2
如何将标准化系数转换为非标准化系数?
我的目标是在给定一组独立变量的情况下,使用先前对该主题的研究得出的系数来预测实际结果。但是,研究论文仅列出了Beta系数和t值。我想知道是否可以将标准化系数转换为非标准化系数。 将我的非标准化独立变量转换为标准化变量以计算预测值是否有用?我将如何返回到非标准化的预测值(如果可能的话) 从纸上添加了示例行: 公交线路数量(公交线路)| 0.275(测试版)| 5.70 ***(t值) 关于自变量,我也得到了这一点: 公交线路数量(公交线路)| 12.56(平均)| 9.02(标准)| 1(分钟)| 53(最大)

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.