统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
有序逻辑回归中的负系数
假设我们有序数响应和我们认为的一组变量将解释。然后,我们对(响应)进行(设计矩阵)的有序逻辑回归。y:{Bad, Neutral, Good}→{1,2,3}y:{Bad, Neutral, Good}→{1,2,3}y:\{\text{Bad, Neutral, Good}\} \rightarrow \{1,2,3\}X:=[x1,x2,x3]X:=[x1,x2,x3]X:=[x_1,x_2,x_3]yyyXXXyyy 假设的估计系数称为,在有序logistic回归中为。如何解释的优势比(OR)?β 1 - 0.5 Ë - 0.5 = 0.607x1x1x_1β^1β^1\hat{\beta}_1−0.5−0.5-0.5e−0.5=0.607e−0.5=0.607e^{-0.5} = 0.607 我说“在一个增加1个单位,其他条件不变,观察的几率是观察的时间赔率,并在相同的变化,观察的几率是观察的时间赔率 “?x1x1x_1GoodGood\text{Good}0.6070.6070.607Bad∪NeutralBad∪Neutral\text{Bad}\cup \text{Neutral}x1x1x_1Neutral∪GoodNeutral∪Good\text{Neutral} \cup \text{Good}0.6070.6070.607BadBad\text{Bad} 在我的教科书或Google中找不到负系数解释的任何示例。

8
插值与回归概念有何关系?
简单解释一下插值的含义。它与回归的概念有什么关系? 插值法是一种在表的各行之间阅读的技巧,在基本数学中,该术语通常表示从该函数的一组给定值或表格值中计算出函数中间值的过程。 我不能回答第二个问题。请帮忙

3
标准错误如何工作?
最近,我一直在研究标准错误的内部机制,但发现自己无法理解它的工作原理。我对标准误差的理解是它是样本均值分布的标准偏差。我的问题是: •当我们通常只采集一个样本时,我们如何知道标准误差是样本均值的标准偏差? •为什么计算标准误差的方程式不能反映单个样品的标准偏差方程式?

2
回归系数的逆变换
我正在使用转换后的因变量进行线性回归。进行了以下转换,以使残差的正态性假设成立。未转换的因变量产生负偏斜,以下转换使其接近正常值: Y=50−Yorig−−−−−−−−√Y=50−YorigY=\sqrt{50-Y_{orig}} 其中YorigYorigY_{orig}是原始量表上的因变量。 我认为在ββ\beta系数上使用一些转换以使其回到原始比例是有意义的。使用以下回归方程, Y=50−Yorig−−−−−−−−√=α+β⋅XY=50−Yorig=α+β⋅XY=\sqrt{50-Y_{orig}}=\alpha+\beta \cdot X 通过固定,我们有X=0X=0X=0 α=50−Yorig−−−−−−−−√=50−αorig−−−−−−−−√α=50−Yorig=50−αorig\alpha=\sqrt{50-Y_{orig}}=\sqrt{50-\alpha_{orig}} 最后, αorig=50−α2αorig=50−α2\alpha_{orig}=50-\alpha^2 使用相同的逻辑,我发现 βorig=α (α−2β)+β2+αorig−50βorig=α (α−2β)+β2+αorig−50\beta_{orig}=\alpha\space(\alpha-2\beta)+\beta^2+\alpha_{orig}-50 现在,对于具有1个或2个预测变量的模型来说,一切工作都很好。逆变换后的系数类似于原始系数,只有现在我可以相信标准误差。问题包括交互项,例如 Y=α+X1βX1+X2βX2+X1X2βX1X2Y=α+X1βX1+X2βX2+X1X2βX1X2Y=\alpha+X_1\beta_{X_1}+X_2\beta_{X_2}+X_1X_2\beta_{X_1X_2} 然后的逆变换与原始比例的逆变换不太接近,我不确定为什么会发生这种情况。我也不确定用于反向转换beta系数的公式是否可以像第三(用于交互项)那样使用。在进入疯狂的代数之前,我想我会寻求建议...βββ\betaββ\beta

1
在设计的实验中,如何在ANOVA和ANCOVA之间进行选择?
我正在进行以下实验: DV:切片消耗(连续或分类) IV:健康消息,不健康消息,无消息(对照)(在其中随机分配了3个组的人员-分类)这是有关切片的健康性的可操纵消息。 以下IV可被视为个体差异变量: 冲动性(可以是分类的,即高与低或连续的,并通过标尺进行测量) 甜味偏爱(这也是通过问卷调查来衡量的,每个问题有3种选择) BMI-将对参与者进行相应的称重(也可以视为绝对或连续)。 由于将各组随机分配到3个组中的一个,因此我假设我正在进行某种ANOVA,并且可能会使用阶乘ANOVA,因为我对哪种IV对DV的影响最大,而且IV之间的相互作用也很感兴趣(如研究所示)某些组合之间存在关系。 但是由于需要知道IV最好是分类的,连续的还是混合的,我对此并不完全确定。 还是ANCOVA是一种可能性甚至是回归,但我不确定,因为将他们分配到了各个小组,然后根据他们对调查的回答进行了分类。 我希望这是有道理的,并希望能收到某人的询问。

1
为什么我们假设错误是正态分布的?
我想知道为什么在对误差建模时使用高斯假设。在斯坦福大学的ML课程中,Ng教授基本上以两种方式对其进行描述: 在数学上很方便。(与最小二乘拟合有关,易于通过伪逆求解) 由于中心极限定理,我们可以假设存在许多影响过程的潜在事实,并且这些单个错误的总和往往表现为零均值正态分布。实际上,情况似乎是这样。 我实际上对第二部分感兴趣。据我所知,中心极限定理适用于iid样本,但我们不能保证基础样本为iid。 您对误差的高斯假设有任何想法吗?

5
如何在R中的glm族参数中指定对数正态分布?
一个简单的问题:如何在R中的GLM系列参数中指定对数正态分布?我找不到如何实现的目标。为什么对数正态(或指数)不是family参数中的选项? 我读到R存档中的某个地方,只需指定GLM中设置为高斯的族的对数链接,即可指定对数正态。但是,这是无稽之谈,因为这将适合非线性回归并且R开始要求起始值。 有人知道如何为GLM设置对数正态(或指数)分布吗?

1
随机变量及其分布的符号约定
我对正确的含义符号以及与随机变量及其分布有关的某些符号的含义感到困惑。在下面,我将列出我认为是正确的事情以及我不理解的事情,我会喜欢输入/更正。为了方便参考,我在每个问题/问题上都标了一个数字。如果在这样的单个问题中列出项目不合适,请告诉我。我以为可以,因为它们都很矮。 随机变量由一个大写字母,如记谱XXX。 对随机变量进行的运算是什么意思?(例如,您如何用词解释X 2X2X^2?)。 来自随机变量的特定绘图用小写字母(例如x)或带下标(例如x 1)的小写字母或带数字(例如X 1)的大写数字表示。xxx1x_1X1X_1 从随机变量X提取的n的k t h阶统计量的随机变量记为X k n。kthkthnnXXXknX_{kn} 是否有一种简便的方式写“ X是由F(x)分配的随机变量(或“ cdf F(x)”或“ B(a,b)”或任何表征分布的方式)”? 我可以写出E F (x )来表示根据F (xEF(x)\mathbb{E}F(x))吗?F(x)F(x) 如果我在变量X的累积分布函数进行操作,例如,˚F Ñ È 瓦特(X )= ˚F Ö 升d(X )2,以获得最大的2从绘制的CDF X,我可以谱写,在计X不知何故?Fnew(x)=Fold(x)2F_{new}(x) = F_{old}(x)^2XXXX 是简洁写出F 2(x )或F (x )2的(F (x ))2的适当方法(F(x))2(F(x))^2F2(x)F^2(x)F(x)2F(x)^2? 离散变量和连续变量之间在符号上有区别吗?

3
拟合多元自然三次样条
注:用了一个月后,没有正确的答案,我要重新发布SO 背景 我有一个模型fff,其中Y=f(X)Y=f(X)Y=f(\textbf{X}) 是来自 m个参数的样本的 n × m矩阵, Y是模型输出的 n × 1向量。XX\textbf{X}n×mn×mn \times mmmmYYYn×1n×1n \times 1 是计算密集型的,因此我想使用多变量三次样条曲线通过(X ,Y )点来近似 f,以便可以在更多点上评估 Y。ffffff(X,Y)(X,Y)(X,Y)YYY 题 是否有R函数可以计算X和Y之间的任意关系? 具体来说,我正在寻找该splinefun函数的多元版本,该版本针对单变量情况生成样条函数。 例如这是 splinefun单变量情况下的工作方式 x <- 1:10 y <- runif(10) foo <- splinefun(x,y) foo(1:10) #returns y, as example all(y == foo(1:10)) ## TRUE 我尝试过的 我已经审查了mda软件包,并且似乎应该可以进行以下操作: library(mda) x <- …

2
计算第95个百分位数:比较正态分布,R Quantile和Excel方法
我试图在以下数据集中计算第95个百分位数。我遇到了一些这样做的在线参考。 方法1:基于样本数据 在第一个告诉我获得TOP 95 Percent的数据集,然后选择MIN或AVG生成的一组。对以下数据集执行此操作即可得到: AVG: 29162 MIN: 0 方法2:假设正态分布 所述第二个说,第95百分位是平均约两个标准差以上(我明白)和I进行的: AVG(Column) + STDEV(Column)*1.65: 67128.542697973 方法3:R Quantile 我曾经R获得第95个百分位: > quantile(data$V1, 0.95) 79515.2 方法4:Excel的方法 最后,我遇到了这个,它解释了Excel是如何做到的。该方法的摘要如下: 给定一组N有序值{v[1], v[2], ...}和要求计算pth百分位数,请执行以下操作: 计算 l = p(N-1) + 1 拆分l成整数和小数成分即l = k + d 将所需值计算为 V = v[k] + d(v[k+1] - v[k]) 这种方法给我 79515.2 尽管我相信R的值是正确的值,但没有一个值匹配(我也从ecdf图中观察到了它)。我的目标是从给定的数据集中手动计算第95个百分位数(仅使用AVG和STDEV函数),并且不确定是否会发生什么。有人可以告诉我我要去哪里错吗? 93150 …
17 r  dataset  quantiles  sql 

5
对于R中的随机森林分类,应该如何针对不平衡的班级规模进行调整?
我正在为我正在研究的项目探索不同的分类方法,并且对尝试“随机森林”感兴趣。我正在努力地进行自我教育,并感谢CV社区提供的任何帮助。 我已将数据分为训练/测试集。通过在R中使用随机森林进行实验(使用randomForest包),我遇到了麻烦,因为我的小班级误分类率很高。我已经阅读了有关随机森林在不平衡数据上的性能的文章,作者提出了两种使用随机森林时处理类不平衡的方法。 1.加权随机森林 2.平衡的随机森林 R软件包不允许对类进行加权(从R帮助论坛中,我已经阅读到classwt参数无法正常运行,并计划将其作为将来的错误修复程序),因此我可以选择选项2。我可以指定随机森林每次迭代从每个类中采样的对象数。 对于为随机森林设置相等的样本大小,我感到不安,因为我好像会丢失太多有关较大类的信息,从而导致将来的数据表现不佳。对较大类别进行下采样时,分类错误率有所提高,但是我想知道在随机森林中是否还有其他方法可以处理类别不平衡的情况?


2
如何在Cox回归中解释Exp(B)?
我是一名医学生,试图了解统计信息(!)-请保持温柔!;) 我正在写一篇包含大量统计分析的文章,其中包括生存分析(Kaplan-Meier,Log-Rank和Cox回归)。 我对数据进行了Cox回归,试图找出两组患者(高风险或低风险患者)的死亡之间是否存在显着差异。 我在Cox回归中添加了几个协变量来控制它们的影响。 Risk (Dichotomous) Gender (Dichotomous) Age at operation (Integer level) Artery occlusion (Dichotomous) Artery stenosis (Dichotomous) Shunt used in operation (Dichotomous) 我从协变量列表中删除了动脉闭塞,因为其SE极高(976)。所有其他SE介于0.064和1,118之间。这是我得到的: B SE Wald df Sig. Exp(B) 95,0% CI for Exp(B) Lower Upper risk 2,086 1,102 3,582 1 ,058 8,049 ,928 69,773 gender -,900 ,733 1,508 …

5
如何在线性回归模型中添加周期分量?
我有一些累积频率数据。线y=ax+by=ax+by=ax+b看起来非常适合数据,但是该行中存在循环/周期性摆动。我想估计累积频率何时达到一定值ccc。当我绘制残差与拟合值的关系图时,我得到了漂亮的正弦曲线行为。 现在,要增加另一个复杂性,请注意在残差图中 有两个周期的值比其他周期低,这表示还必须考虑到周末效应。 那么,我从这里去哪里呢?如何将一些余弦,正弦或循环项合并到回归模型中,以得到近似值。估计何时累积频率等于?ccc

1
HMM在量化金融中的使用。可以检测趋势/转折点的HMM示例?
我正在发现所谓的“隐马尔可夫模型”(也称为“制度转换模型”)的奇妙世界。我想在R中使用HMM来检测趋势和转折点。我想建立尽可能通用的模型,以便可以在许多价格上对其进行测试。 谁能推荐一篇论文?我已经看过(并阅读)了(不止)一些,但是我正在寻找一个易于实现的简单模型。 另外,建议使用哪些R软件包?我可以看到有很多人在做HMM。 我已经买了《时间序列的隐马尔可夫模型:使用R的介绍》这本书,让我们看一下其中的内容吧;) 弗雷德

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.