统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
使用哪个距离?例如,曼哈顿,欧几里得,布雷-柯蒂斯等
我不是社区生态学家,但是这些天我正在研究社区生态数据。 除了这些距离的数学运算之外,我无法理解的是每种距离的使用标准以及在何种情况下可以使用该距离。例如,对计数数据使用什么?如何将两个位置之间的倾斜角度转换为距离?还是两个地点的温度或降雨?每个距离的假设是什么,什么时候有意义?

1
似然比检验和Wald检验为R中的glm提供了不同的结论
我正在从通用模型,线性模型和混合模型复制示例。我的MWE如下: Dilution <- c(1/128, 1/64, 1/32, 1/16, 1/8, 1/4, 1/2, 1, 2, 4) NoofPlates <- rep(x=5, times=10) NoPositive <- c(0, 0, 2, 2, 3, 4, 5, 5, 5, 5) Data <- data.frame(Dilution, NoofPlates, NoPositive) fm1 <- glm(formula=NoPositive/NoofPlates~log(Dilution), family=binomial("logit"), data=Data) summary(object=fm1) 输出量 Call: glm(formula = NoPositive/NoofPlates ~ log(Dilution), family = binomial("logit"), …

4
Python中的主成分分析和回归
我试图找出如何在Python中重现我在SAS中所做的一些工作。使用这个存在多重共线性问题的数据集,我想在Python中执行主成分分析。我看过scikit-learn和statsmodels,但是我不确定如何获取它们的输出并将其转换为与SAS相同的结果结构。一方面,当您使用时,SAS似乎在相关矩阵上执行PCA PROC PRINCOMP,但是大多数(全部?)Python库似乎都在使用SVD。 在数据集中,第一列是响应变量,接下来的5个是预测变量,称为pred1-pred5。 在SAS中,常规工作流程为: /* Get the PCs */ proc princomp data=indata out=pcdata; var pred1 pred2 pred3 pred4 pred5; run; /* Standardize the response variable */ proc standard data=pcdata mean=0 std=1 out=pcdata2; var response; run; /* Compare some models */ proc reg data=pcdata2; Reg: model response = pred1 pred2 …


1
训练卷积神经网络
我目前正在开发使用卷积神经网络识别面部的面部识别软件。根据我的阅读,我收集到卷积神经网络具有权重,以节省训练时间。但是,如何适应反向传播,以便可以在卷积神经网络中使用。在反向传播中,人们使用与此类似的公式来训练权重。 New Weight = Old Weight + LEARNING_RATE * 1 * Output Of InputNeuron * Delta 但是,由于在卷积神经网络中权重是共享的,因此每个权重都与多个神经元一起使用,那么如何确定使用哪个权重Output of InputNeuron? 换句话说,由于权重是共享的,我该如何决定将权重改变多少?

3
出版物中有哪些潜伏变量在受控实验中的例子?
在本文中: 潜伏变量:一些示例 Brian L. Joiner,《美国统计学家》第 35,第4号,1981年11月227-233 布莱恩·乔纳(Brian Joiner)声称“随机化不是万能药”。这与以下常见声明相反: 一个经过精心设计的实验包括一些设计功能,这些功能使研究人员可以消除无关的变量,以解释所观察到的自变量与因变量之间的关系。这些无关的变量称为潜伏变量。 引文来自这个问题,没有任何消息来源,但以我的经验,它代表了当时的主流态度: 潜伏变量和有影响力的观察的例子 给出的一个例子是,在70年代测试40号红色食用染料对啮齿动物的安全性(特别是致癌作用)时,发现笼子位置的影响使这项研究感到困惑。现在,我已经阅读了许多研究啮齿动物致癌作用的期刊文章,却从未见过有人报告过控制这种作用的报道。 这些研究的进一步讨论可以在这里找到: 监管过程中的统计案例研究:FD&C Red No. 40实验。 我找不到非付费版本,但以下是摘录: 在1月的会议上,我们进行了初步分析(14),该分析揭示了笼行与RE(网状内皮肿瘤)死亡率之间的密切相关,其死亡率从17%(下排)到32%(上排)不等(表2)。我们无法通过性别,剂量组,机架列或位置来解释这种强烈的关联。随后的分析(18)也表明笼子的位置(前部和后部)可能与非RE死亡相关,而该位置与非RE死亡时间相关。 我特别想知道为什么医学文献中的复制似乎存在这样的问题,但是欢迎所有领域的例子。请注意,我对随机对照实验(而非观察性研究)中的示例感兴趣。

4
不确定类别标签的分类器
假设我有一组与类标签相关联的实例。不要紧,怎么这些情况下进行标记,但如何某些他们班的成员是。每个实例恰好属于一个类。假设我可以使用从1到3的名义属性(分别非常确定和不确定)来量化每个类成员的确定性。 是否有某种分类器考虑了这样的确定性度量,如果是,则在WEKA工具箱中可用吗? 我想这种情况经常发生,例如,当实例不是由人完全确定时,就由人对它们进行分类。就我而言,我必须对图像进行分类,有时图像可能属于多个类别。如果发生这种情况,我会给班级带来很大的不确定性,但仍然只对一个班级进行分类。 或者,没有专门的分类器,还有其他方法可以解决此问题吗?例如,仅采用“某些”分类进行培训?我担心在这种情况下,会出现更多的错误分类,因为没有涵盖“边界”案件。

2
感知器的决策边界图
我试图绘制感知器算法的决策边界,我对一些事情感到非常困惑。我的输入实例的格式为,基本上是2D输入实例(x 1和x 2)和二进制类目标值(y)[1或0]。[ (x1个,X2),ÿ][(x1,x2),y][(x_{1},x_{2}), y]X1个x1x_{1}X2x2x_{2}ÿyy 因此,我的权重向量的形式为:。[w1,w2][w1,w2][w_{1}, w_{2}] 现在我必须合并一个额外的偏置参数,因此我的权重向量变成3 × 1向量?是1 × 3向量吗?我认为应该是1 × 3,因为向量只有1行n列。w0w0w_{0}3×13×13 \times 11×31×31 \times 31×31×31 \times 3 现在假设我将实例化为随机值,该如何绘制决策边界?含义w 0在这里表示什么?是瓦特0 / Ñ ø ř 米(瓦特)的判定区域的离原点的距离是多少?如果是这样,我如何捕获它并使用matplotlib.pyplot或其等效的Matlab在Python中绘制它?[w0,w1,w2][w0,w1,w2][w_{0}, w_{1}, w_{2}]w0w0w_{0}w0/norm(w)w0/norm(w)w_{0}/norm(w) 对于这个问题,我什至会提供一点帮助。

3
两种高斯混合物之间的距离以评估聚类解
我正在运行一个快速仿真以比较不同的群集方法,并且目前遇到了尝试评估群集解决方案的障碍。 我知道各种验证指标(许多在R 中的cluster.stats()中找到),但是我假设如果估计的集群数量实际上等于集群的真实数量,则最好使用这些验证指标。我想保持一种能力,可以测量在原始模拟中未指定正确数量的聚类解决方案时聚类解决方案的性能(即,模拟为具有4个聚类的三个聚类解决方案模型数据的性能如何)解)。仅作为您的参考,对群集进行模拟以拥有相同的协方差矩阵。 我认为高斯的两种混合之间的KL散度将对实现有用,但是不存在封闭形式的解决方案(Hershey和Olson(2007年)),实现蒙特卡洛模拟的计算开始变得昂贵。 是否还有其他可能易于实现的解决方案(即使只是一个近似值)?

1
随机森林算法步骤背后的动机
我熟悉的用于构建随机森林的方法如下:(来自http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm) 要在森林中建树,我们: 引导一个大小为N的样本,其中N是我们的训练集的大小。使用此引导示例作为此树的训练集。 在树的每个节点上,随机选择M个特征中的m个。在这m个功能中选择最佳以进行拆分。(其中m是我们的随机森林的参数) 使每棵树最大程度地生长-即不修剪。 虽然此算法在程序级别上有意义并且肯定会产生良好的结果,但我不清楚步骤1、2和3背后的理论动机是什么。请问有人可以解释是什么促使有人提出了此过程以及为什么要这样做效果很好? 例如:为什么我们需要执行步骤1?似乎我们没有为减少偏差的通常目的而自举。

2
为什么随机效应模型要求效应与输入变量不相关,而固定效应模型却允许相关性?
来自维基百科 关于个体特定效应,有两个共同的假设,即随机效应假设和固定效应假设。随机效应假设(在随机效应模型中做出)是各个特定效应与自变量不相关。固定效应假设是个体特定效应与自变量相关。如果随机效应假设成立,则随机效应模型比固定效应模型更有效。但是,如果该假设不成立(即,如果Durbin-Watson检验失败),则随机效应模型将不一致。 我想知道为什么随机效果模型要求随机效果与输入变量不相关,而固定效果模型允许效果与输入变量相关? 谢谢!

3
累积/累积图(或“可视化洛伦兹曲线”)
我不知道这些图被称为什么,因此我给这个问题一个愚蠢的标题。 假设我有一个如下的有序数据集 4253 4262 4270 4383 4394 4476 4635 ... 每个数字对应于某个用户在网站上发布的帖子数量。我正在根据经验调查这里定义的“参与不平等”现象。 为了便于掌握,我想制作一个图表,使读者可以快速推断出诸如“ 10%的用户贡献50%的数据”之类的陈述。它看起来应该类似于这个公认的糟糕的油漆草图: 我不知道如何称呼它,因此我不知道在哪里寻找。另外,如果有人在中实现R,那将是非常棒的。

2
为什么后验密度与先验密度乘以似然函数成比例?
根据贝叶斯定理,。但是根据我的计量经济学文本,它说。为什么会这样呢?我不明白为什么被忽略。P (θ | y )∝ P (y | θ )P (θ )P (y )P(y| θ)P(θ )= P(θ | y)P(y)P(y|θ)P(θ)=P(θ|y)P(y)P(y|\theta)P(\theta) = P(\theta|y)P(y)P(θ | y)α P(y| θ)P(θ )P(θ|y)∝P(y|θ)P(θ)P(\theta|y) \propto P(y|\theta)P(\theta)P(y)P(y)P(y)

3
关于正规方程证明的问题
在不假设X是可逆的前提下,如何证明正则方程具有一个或多个解?(XTX)β=XTY(XTX)β=XTY(X^TX)\beta = X^TY 我唯一的猜测是它与广义逆有关,但是我完全迷失了。
11 regression  proof 

1
如何用样条/平滑回归预测新数据
在使用平滑/样条线作为预测模型时,谁能提供关于如何对新数据进行预测的概念性解释?例如,给定一个模型,该模型在R gamboost的mboost包中使用创建,带有p样条曲线,那么如何预测新数据?训练数据使用了什么? 假设自变量x有一个新值,并且我们要预测y。在训练模型时是否使用结或df将用于创建样条曲线的公式应用于该新数据值,然后将来自训练模型的系数应用于输出预测? 这是R的示例,对于新数据mean_radius = 15.99,预测在概念上将输出899.4139吗? #take the data wpbc as example library(mboost) data(wpbc) modNew<-gamboost(mean_area~mean_radius, data = wpbc, baselearner = "bbs", dfbase = 4, family=Gaussian(),control = boost_control(mstop = 5)) test<-data.frame(mean_radius=15.99) predict(modNew,test)

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.