统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
方差较大的预测变量是否“更好”?
我有一个“基本统计”概念问题。作为一名学生,我想知道我是否在想这完全错误,为什么,如果这样: 假设我正在假设要查看“愤怒管理问题”之间的关系,并在逻辑回归中说离婚(是/否),并且我可以选择使用两个不同的愤怒管理评分-满分均为100。 得分1来自问卷评分工具1和我的其他选择;得分2来自另一份问卷。假设地,我们有理由相信从先前的工作中,愤怒的管理问题会导致离婚。 如果在我的500个人的样本中,得分1的方差比得分2的方差高得多,是否有任何理由相信得分1将是基于其方差来预测离婚的更好得分? 在我看来,这本能地似乎是正确的,但是是这样吗?

2
当稀有性是由于大量反事实事件而导致的“稀有”事件的监督学习
假设您观察到市场中买卖双方之间的“匹配”。您还可以观察买家和卖家的特征,以用于预测未来的比赛并向市场双方提出建议。 为简单起见,假设有N个买家和N个卖家,并且每个人都找到一个匹配项。有N个匹配项和(N-1)(N-1)个不匹配项。包罗万象的训练数据集具有N +(N-1)*(N-1)个观测值,这可能会过大。从(N-1)(N-1)个不匹配项中随机采样并在减少的数据上训练算法似乎更为有效。我的问题是: (1)从不匹配项中采样以构建训练数据集是否是解决此问题的合理方法? (2)如果(1)为真,是否有严格的方法来确定要包含的(N-1)(N-1)块中有多少?

2
放在表格中的有效数字有多少?
是否有建立合理的规则来公布重要数字? 以下是一些具体的示例/问题: 有什么方法可以将有效数字的数量与变异系数相关联?例如,如果估计值为12.3,CV为50%,是否意味着以“ .3”表示的信息接近零? 如果置信区间的数量级范围内,它们是否仍应具有相同数量的有效数字,例如: 12.3(1.2,123.4)和12(1.2,120) 误差估计中的有效位数应等于或小于平均值的有效位数吗?
13 tables 

5
卡方可以用来比较比例吗?
我已经读过,卡方检验对于查看样本是否与一组预期值显着不同很有用。 例如,这是有关人们最喜欢的颜色的调查结果表(总共n = 15 + 13 + 10 + 17 + 55 = 55): red,blue,green,yellow 15,13,10,17 卡方检验可以告诉我该样本是否与人们喜欢每种颜色的概率相同的零假设显着不同。 问题:可以对喜欢某种颜色的总受访者的比例进行测试吗?如下所示: red,blue,green,yellow 0.273,0.236,0.182,0.309 当然,这里0.273 + 0.236 + 0.182 + 0.309 = 1。 如果在这种情况下不适合使用卡方检验,那将是什么检验?谢谢! 编辑:我在下面尝试了@RomanLuštrik的答案,并得到以下输出,为什么我没有得到p值,为什么R说“卡方近似可能不正确”? > chisq.test(c(0,0,0,8,6,2,0,0),p = c(0.406197174,0.088746395,0.025193306,0.42041479,0.03192905,0.018328576,0.009190708,0)) Chi-squared test for given probabilities data: c(0, 0, 0, 8, 6, 2, 0, 0) X-squared …

1
重叠数据的时间序列回归
我看到了一个回归模型,该模型正在回归滞后(12个月)的按年股票指数回报率,相同股票指数的按年回报率,信用利差(无风险债券和公司债券的月均值之差)收益率),同比通胀率和工业生产同比指数。 因此看起来(尽管在这种情况下,您可以替换印度的特定数据): SP500YOY(T) = a + b1*SP500YOY(T-12) + b2*CREDITSPREAD(T) + b4*INDUSTRIALPRODUCTION(T+2) + b3*INFLATION(T+2) + b4*INFLATIONASYMM(T+2) SP500YOY是SP500指数的按年回报。要计算此值,请计算SP500值的每月平均值,然后转换为每个月的按年回报(即Jan'10-Jan'11,Feb'10- 11月2日,3月10日至11月3日...)。在解释变量方面,SP500YOY的12个月滞后值与时间T处的CREDITSPREAD以及提前两个月的INFLATION和INDUSTRIALPRODUCTION一起使用。对于通货膨胀率是否高于阈值5.0%,INFLATIONASYMM是一个虚拟对象。括号中的索引显示每个变量的时间索引。 这是通过标准OLS线性回归估算的。要使用此模型预测SP500的同比1,2和3个月的同比回报,就必须对通货膨胀和工业生产指数产生3-4和5个月的提前预测。这些预测是在将ARIMA模型分别适合两个模型之后进行的。提前1,2和3个月的CreditSpread预测只是作为心理估计。 我想知道这种OLS线性回归是正确/不正确,有效/无效还是普遍有效的统计实践。 我看到的第一个问题是使用重叠数据。即,将股票指数的每日价值每月平均,然后用于计算按月结转的年收益。这应该使错误项自相关。我认为必须在以下其中一种情况下使用“更正”: 怀特的异方差一致性协方差估计器 Newey&West异方差和自相关一致(HAC)估计量 Hans&Hodrick的异方差一致版本 对这些重叠数据应用标准OLS线性回归(不进行任何校正)是否真的有意义,并且更进一步,使用3周期ARIMA提前预测值作为解释变量,以在原始OLS线性回归中预测SP500YOY?我以前从未见过这样的形式,因此,除非对重叠观察的使用进行校正,否则无法真正判断它。

3
需要帮助通过直方图确定分布
我具有某个信号的已记录振幅最大值的样本总数。人口约为1500万样本。我生成了人口的直方图,但无法用这种直方图猜测分布。 EDIT1:带有原始样本值的文件在这里:原始数据 任何人都可以使用以下直方图来帮助估计分布:

1
Logistic回归,方向数据为IV
我正在寻找有关使用方向数据(以度为单位的度量)作为回归中的自变量的良好参考;理想情况下,它对于分层非线性模型(数据嵌套)也很有用。我也对定向数据更感兴趣。 我找到了我将要获得的Mardia文本,但想知道是否有好的文章。 我对实用的文章中有关如何处理此类数据的文章更感兴趣,而不是定理和证明或分布等形式声明。谢谢 更新我已经得到了Mardia文本,内容非常全面。经过一番阅读之后,我可能还会有更多问题。

3
具有无限方差的正态分布的值大于平均值的概率是多少?
今天在面试中我被问到类似的问题。 面试官想知道,当波动性趋于无穷大时,平价期权最终会平价化的可能性是多少。 我说0%是因为在Black-Scholes模型和随机游走假设下的正态分布将具有无限方差。因此,我计算出所有值的可能性为零。 我的面试官说正确的答案是50%,因为正态分布仍将是对称且几乎均匀的。因此,当您从均值到+无穷大积分时,您将获得50%。 我仍然不相信他的推理。 谁是对的?

4
两个随机变量中较小者的无偏估计量
假设和ý 〜Ñ(μ Ý,σ 2 ÿ)X〜ñ(μX,σ2X)X∼N(μx,σx2)X \sim \mathcal{N}(\mu_x, \sigma^2_x)ÿ〜ñ(μÿ,σ2ÿ)Y∼N(μy,σy2)Y \sim \mathcal{N}(\mu_y, \sigma^2_y) 我对。是否存在z的无偏估计量?ž= 分钟(μX,μÿ)z=min(μx,μy)z = \min(\mu_x, \mu_y)žzz \ min(\ bar {x},\ bar {y})的简单估计量有偏差(尽管一致),分钟(x¯,ÿ¯)min(x¯,y¯)\min(\bar{x}, \bar{y})其中X¯x¯\bar{x}和ÿ¯y¯\bar{y}是XXX和Y的样本均值ÿYY。它倾向于下冲žzz。 我想不出z的无偏估计量žzz。是否存在? 谢谢你的帮助。

1
拟合“简单”测量误差模型的方法
我正在寻找可用于估计“ OLS”测量误差模型的方法。 X 我 = X 我 + ë X ,我 ÿ 我 = α + β X 我ÿ一世= Y一世+ eÿ,我yi=Yi+ey,iy_{i}=Y_{i}+e_{y,i} X一世= X一世+ eX ,我xi=Xi+ex,ix_{i}=X_{i}+e_{x,i} ÿ一世= α + βX一世Yi=α+βXiY_{i}=\alpha + \beta X_{i} 其中的误差是独立的正常与未知方差和σ 2 X。在这种情况下,“标准” OLS无效。σ2ÿσy2\sigma_{y}^{2}σ2Xσx2\sigma_{x}^{2} 维基百科有一定的吸引力的解决方案-这两个给力您认为无论是“变化率” 或“可靠性比”λ=σ 2 Xδ= σ2ÿσ2Xδ=σy2σx2\delta=\frac{\sigma_{y}^{2}}{\sigma_{x}^{2}}是已知的,其中σ 2 X是真回归的方差X我。我对此不满意,因为不知道方差的人怎么知道其比率?λ = σ2Xσ2X+ σ2Xλ=σX2σx2+σX2\lambda=\frac{\sigma_{X}^{2}}{\sigma_{x}^{2}+\sigma_{X}^{2}}σ2XσX2\sigma_{X}^2X一世XiX_i 无论如何,除了这两个以外,还有其他解决方案不需要我“了解”参数的任何信息吗? 仅截距和斜率的解决方案就可以了。

4
R / Stata软件包用于零截断的负二项式GEE?
这是我的第一篇文章。我非常感谢这个社区。 我正在尝试分析被零截断的纵向计数数据(响应变量= 0的概率为0)和均值=方差,因此在泊松上选择了负二项式分布。 我排除的功能/命令: [R R中的gee()函数不考虑零截断或负二项式分布(即使加载了MASS包也不) R中的glm.nb()不允许使用不同的相关结构 VGAM软件包中的vglm()可以利用正负二项式族,但它与Stata的ztnb命令(请参见下文)存在相同的问题,因为我无法使用非独立的相关结构来重新拟合模型。 斯塔塔 如果数据不是纵向的,那么我可以使用Stata包ztnb来运行分析,但是该命令假定我的观察是独立的。 由于各种方法论/哲学上的原因,我也排除了GLMM。 现在,我已经开始考虑Stata的xtgee命令(是的,我知道xtnbreg也会做同样的事情),该命令既考虑了非独立相关结构又考虑了负二项式族,但没有考虑零截断。使用xtgee的另一个好处是,我还可以计算qic值(使用qic命令)来确定响应变量的最佳拟合相关结构。 如果R或Stata中有一个程序包/命令可以考虑1)宾果式族,2)GEE和3)零截断,我想知道。 我非常感谢您可能有任何想法。谢谢。 -凯西

2
了解聚类结果的比较
我正在尝试将数据分类。我对这个主题还很陌生,并试图了解一些分析的结果。 使用Quick-R中的示例,R建议使用几个软件包。我尝试使用其中两个包(fpc使用kmeans函数和mclust)。我不了解这种分析的一个方面是结果的比较。 # comparing 2 cluster solutions library(fpc) cluster.stats(d, fit1$cluster, fit2$cluster) 我已经通读了fpc 手册的相关部分,但仍不清楚我的目标是什么。例如,这是比较两种不同聚类方法的输出: $n [1] 521 $cluster.number [1] 4 $cluster.size [1] 250 119 78 74 $diameter [1] 5.278162 9.773658 16.460074 7.328020 $average.distance [1] 1.632656 2.106422 3.461598 2.622574 $median.distance [1] 1.562625 1.788113 2.763217 2.463826 $separation [1] 0.2797048 0.3754188 0.2797048 0.3557264 $average.toother …
13 r  clustering 

3
多元Bernoulli分布的概率公式
我需要的事件的在正变量贝努利分布的概率的公式X∈ { 0 ,1 }ñX∈{0,1个}ñX\in\{0,1\}^n与给定的P(X一世= 1 )= p一世P(X一世=1个)=p一世P(X_i=1)=p_i为单个元件和用于对元素的概率P(X一世= 1 ∧ XĴ= 1 )= p我ĴP(X一世=1个∧XĴ=1个)=p一世ĴP(X_i=1 \wedge X_j=1)=p_{ij}。等效地,我可以给出均值和协方差XXX。 我已经了解到,存在许多{ 0 ,1 }ñ{0,1个}ñ\{0,1\}^n分布具有性能就像有具有给定的均值和方差许多发行。我找了一个规范的一个{ 0 ,1 }ñ{0,1个}ñ\{0,1\}^n,就像高斯是一个正则分布[Rñ[RñR^n和给定的均值和方差。

3
使用GLMNET还是LARS计算LASSO解决方案?
我想获得LASSO问题的系数 | | ÿ- Xβ| | +λ | | β| |1个。||Y−Xβ||+λ||β||1.||Y-X\beta||+\lambda ||\beta||_1. 问题是glmnet和lars函数给出不同的答案。对于glmnet函数,我要求的系数。| Y | | 而不只是,但我仍然得到不同的答案。λ / | | ÿ| |λ/||Y||\lambda/||Y||λλ\lambda 这是预期的吗?lars和glmnet之间是什么关系?我知道glmnet解决LASSO问题的速度更快,但是我想知道哪种方法更强大?λλλ\lambdaλλ\lambda deps_stats恐怕我的数据集太大,以至于LARS无法处理它,而另一方面glmnet可以处理我的大型数据集。 mpiktas我想找到(Y-Xb)^ 2 + L \ sum | b_j |的解决方案 但是,当我从两种算法(拉尔斯和glmnet)询问它们对于特定L的计算系数时,我得到了不同的答案……我想知道这是正确的/预期的吗?或者我只是为两个函数使用了错误的lambda。

2
时空预测误差的探索性分析
数据:我最近致力于分析风电产量预测误差的时空场的随机特性。在形式上,可以说是一个过程 在时间上两次索引(分别为t和h),在空间上一次索引(p),其中H为超前次数(等于约24,有规律地采样),T为“预测时间”(即发布预测的时间,在我的情况下大约为30000,定期进行采样),n为多个空间位置(未网格化,在我的情况下为300)。由于这是与天气有关的过程,因此我也有大量可以使用的天气预报,分析和气象测量。(ϵpt + h | Ť)t = 1 … ,T;h = 1 ,... ,H,p = p1个,… ,pñ(ϵt+h|tp)t=1…,T;h=1,…,H,p=p1,…,pn \left (\epsilon^p_{t+h|t} \right )_{t=1\dots,T;\; h=1,\dots,H,\;p=p_1,\dots,p_n}ŤttHhhpppHHH242424ŤŤTññn 问题:您能否描述一下您将对此类数据执行的探索性分析,以了解过程的相互依赖结构(可能不是线性的)的本质,以便为它提出更好的模型。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.