统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
自我学习能带给我多远?
我从未参加过官方或结构化的数据分析或机器学习课程(最近的在线产品除外),并且从阅读和尝试中学到了很多我所知道的知识。我知道我离找到工作很远。 我的问题不是哪个更好(像这个问题一样),而是我可以达到一个可以申请工作并且实际上有机会独自学习的水平吗?另外,是否可以在合理的时间范围内(可能是10年?我现在31岁了...)? 还是我必须找到一种参加某种大学/大学的方法?

1
LDA的代数。变量的Fisher判别力和线性判别分析
显然, Fisher分析的目的是同时最大化类之间的距离,同时最小化类内离散。因此,对角线量给出了变量判别力的有效度量。Bii/WiiBii/WiiB_{ii}/W_{ii} http://root.cern.ch/root/htmldoc/TMVA__MethodFisher.html 我了解p x p之间(B)和内部类(W)矩阵的大小()由输入变量的数量给出p。鉴于此,Bii/WiiBii/WiiB_{ii}/W_{ii}如何成为单个变量的“有用的判别量”?构造矩阵B和W至少需要两个变量,因此各个迹线将代表一个以上的变量。 更新:我是否认为不是隐含总和的迹线,而是矩阵元素除以的迹线?目前,这是使表达式与概念保持一致的唯一方法。 B 我我 W¯¯ 我我Bii/WiiBii/WiiB_{ii}/W_{ii}BiiBiiB_{ii}WiiWiiW_{ii}

1
比率分析技术
我正在寻找有关比率和费率分析的建议和意见。在我工作的领域中,尤其是比率的分析非常普遍,但是我已经阅读了几篇论文,表明这可能是有问题的,我在想: Kronmal,Richard A.1993。重新讨论了比率标准的虚假相关和谬误。皇家统计协会杂志A 156(3):379-392 及相关论文。根据我到目前为止所读的内容,比率似乎可以产生虚假的相关性,迫使回归线穿过原点(这并不总是合适的),并且如果不正确地进行建模,可能会违反边际原理(在理查德·戈德斯坦(Richard Goldstein)中使用比率回归))。但是,在某些情况下必须合理使用比率,我希望统计学家对此发表一些意见。

2
泊松与逻辑回归
我有一组不同随访时间的患者。到目前为止,我无视时间方面,只需要对二进制结果-疾病/无疾病建模。我通常在这些研究中进行逻辑回归,但是我的另一个同事问泊松回归是否合适。我对泊松不是很感兴趣,对于在这种情况下进行泊松的利弊可与logistic回归进行比较尚不确定。我阅读了Poisson回归以估计二元结果的相对风险,但在这种情况下我仍不确定Poisson回归的优点。



2
如何解释Stata中的概率模型?
我不确定如何解释我在Stata上运行的概率回归。数据是关于贷款批准的,白色是一个虚拟变量,如果一个人是白人,则为= 1,否则为= 0。任何有关如何阅读此书的帮助将不胜感激。我最想寻找的是如何找到白人和非白人的贷款批准估计概率。有人可以帮我解决这里的文字以及如何使其正常吗?对不起,我不知道该怎么做。 . probit approve white Iteration 0: log likelihood = -740.34659 Iteration 1: log likelihood = -701.33221 Iteration 2: log likelihood = -700.87747 Iteration 3: log likelihood = -700.87744 Probit regression Number of obs = 1989 LR chi2(1) = 78.94 Prob > chi2 = 0.0000 Log likelihood = …

1
机器学习中的特征构建和规范化
可以说我想为电影M创建一个Logistic分类器。我的特征将是诸如人的年龄,性别,职业,位置之类的东西。因此,训练集将类似于: 年龄性别职业位置Like(1)/ Dislike(0) 23 M软件US 1 24 F Doctor UK 0 等等。...现在我的问题是我应该如何缩放和表示我的特征。我想过的一种方法是:将年龄划分为年龄组,因此18-25、25-35、35岁以上,性别为M,F,位置为美国,英国,其他。现在为所有这些值创建一个二进制特征,因此age将具有3个二进制特征,每个特征对应于一个年龄组,依此类推。因此,来自美国的28岁男性将被表示为010 10 100(010->年龄组25-35,10->男性,100->美国) 在这里表示功能的最佳方法是什么?另外,我在一些例子中也注意到了。sklearn的研究表明所有特征均已按某种方式进行了缩放/归一化,例如,性别由两个值分别代表,男性和女性为0.0045和-.0.0045。我不知道如何进行这样的缩放/道德化?

2
是否有用于连续时间纵向二进制响应的R包?
该bild软件包似乎是用于串行二进制响应的出色软件包。但这是离散时间。我想为时间响应的平滑函数指定电流响应Y的比值比对与在较早时间测量的二进制响应,或者至少是一阶马尔可夫版本。我相信这称为交替逻辑回归。有谁知道R包可以处理连续时间,即测量时间可以在任何后续时间进行吗?我不需要模型中的随机效应。

2
R中的随机微分方程的数值求解器:有吗?
我正在寻找一种通用,干净,快速(即使用C ++例程)的R包,用于使用Euler-Maruyama方案,Milstein方案(或任何其他方案)模拟非均匀非线性扩散(如(1))的路径。这注定要嵌入到更大的估计代码中,因此值得优化。 dXt=f(θ,t,Xt)dt+g(θ,t,Xt)dWt,(1)(1)dXt=f(θ,t,Xt)dt+g(θ,t,Xt)dWt,dX_t = f(\theta, t, X_t)\, dt + g(\theta, t, X_t)\, dW_t, \tag{1} 与标准布朗运动。 WtWtW_t

1
自举样本均值时是否需要居中?
当阅读有关如何近似估计样本均值的分布时,我遇到了非参数自举方法。显然,可以通过的分布来近似的分布,其中表示样本均值引导程序样本。X¯n−μX¯n−μ\bar{X}_n-\muX¯∗n−X¯nX¯n∗−X¯n\bar{X}_n^*-\bar{X}_nX¯∗nX¯n∗\bar{X}_n^* 然后我的问题是:我需要居中吗?做什么的? 我不能只用近似吗?P(X¯n≤x)P(X¯n≤x)\mathbb{P}\left(\bar{X}_n \leq x\right)P(X¯∗n≤x)P(X¯n∗≤x)\mathbb{P}\left(\bar{X}_n^* \leq x\right)

2
如果p> n,套索最多选择n个变量
弹性网的动机之一是对LASSO的以下限制: 在情况下,由于凸优化问题的性质,套索在饱和之前最多选择n个变量。这似乎是变量选择方法的限制功能。此外,除非系数的L1-范数上的界限小于某个值,否则套索的定义不明确。p>np>np > n (http://onlinelibrary.wiley.com/doi/10.1111/j.1467-9868.2005.00503.x/full) 我知道LASSO是一个二次规划问题,但也可以通过LARS或逐元素梯度下降来解决。但是我不明白,如果,其中是预测变量的数量,是样本大小,那么在这些算法中我会遇到问题。为什么使用弹性网解决了这个问题,我将问题扩大到明显超过变量。p n p + n pp>np>np > npppnnnp+np+np+nppp

1
优化问题
我的一个朋友卖型号的搅拌机。一些搅拌器非常简单且便宜,而另一些则非常复杂且更昂贵。他的数据包括每个月的每个搅拌机的价格(由他确定)和每种型号的已售数量。为了建立某种表示法,他知道几个月j = 1 ,… ,n个向量 (p 1 j,… ,p k j)ķķkj = 1 ,… ,nĴ=1个,…,ñj=1,\dots,n 其中 p 我Ĵ是混合器模型的价格我月期间 Ĵ,和 Ñ 我Ĵ是混合器模型的售出单元数量我月期间 Ĵ。(p1 Ĵ,… ,pķ Ĵ)和(n1 Ĵ,… ,nķ Ĵ),(p1个Ĵ,…,pķĴ)和(ñ1个Ĵ,…,ñķĴ), (p_{1j},\dots,p_{kj}) \qquad \textrm{and} \qquad (n_{1j},\dots,n_{kj}) \, , p我Ĵp一世Ĵp_{ij}一世一世iĴĴjñ我Ĵñ一世Ĵn_{ij}一世一世iĴĴj 给定数据,他想确定价格,以使他的预期未来销售价值最大化。(p∗1个,… ,p∗ķ)(p1个∗,…,pķ∗)(p^*_1,\dots,p^*_k) 我对如何使用某种泊松回归来开始对这个问题进行建模有一些想法,但是我真的不想重新发明轮子。证明期望的最大值在某些条件下存在也很好。有人能给我指出这类问题的文献吗?

1
线性回归与空间自相关
我想使用通过遥感获得的一些变量来预测某个地区的树高。像近似生物量,等等。我想首先使用线性回归(我知道这不是最好的主意,但这对我的项目来说是必不可少的步骤)。我想知道空间自相关对它的影响有多严重,如果可能的话,最简单的纠正方法是什么。顺便说一下,我正在R中做所有事情。

1
自举是评估中位数估计不确定性的有效方法吗?
自举法很好地处理了均值估计中的不确定性,但是我记得在某个地方阅读引导程序并不能很好地评估分位数估计中的不确定性(尤其是中位数)。 我不记得在哪里读过这篇文章,并且无法通过Google快速搜索找到很多东西。对此的想法和任何参考将不胜感激。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.