统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
如何确定在线扑克网站是否公平?
上周,我与我的一个好朋友进行了有趣的讨论。他一直在玩一些在线扑克游戏,并建议新的订阅/其他转账与您所获得的卡之间存在某种关系,即,您获得了不错的卡而上瘾。如果这是真的,那么网站可能会冒很大的风险,但是问题仍然让我着迷。 我的第一种方法是让我的朋友定义“好卡片”并进行简单的二项式检验。我的朋友很难定义什么是好卡片。如果他真的得到了不好的牌,他就知道弃牌,而如果他得到了好牌,他就知道全押-劣牌是介于两者之间的牌。 我的另一种方法是计算每只给定手牌的确切概率,然后查看它是否与预期不同,也许使用Wilcoxon符号秩检验,因为这应该检测到不同的分布形状以及真实的移动。我想最难的部分是计算确切的概率。 数据将包含最初的0-100张发牌,而一周后为300-400张发牌(或在网站上待了一段时间的朋友)。 问题:您如何建议解决此问题? 德州扑克的运作方式 我不是专家,玩家(我只玩德州扑克的3-4倍),但它是相当简单的,你可以找到的维基百科页面的更多细节在这里。 与常规扑克的主要区别是开始时只能获得2张牌。您无需切换这些卡。桌上还有另外5张牌面朝下。通过将您的两个与表5相结合,您可以选择5张最好的纸牌游戏手。 例如,如果您获得2个A,您将有一个良好的开端,并且可能会获得强大的成绩;同样,如果您拥有7和2,您的获胜机会非常渺茫,并且您很快弃牌。困难的部分可能是女王/王后和9,尽管您的牌面高于“平均数”,但您最终可能一无所有。您可以在此处找到扑克手名单。

1
为什么Rm中的rlm()回归系数估计与lm()不同?
我在R MASS软件包中使用rlm回归多元线性模型。它适用于许多样本,但对于特定模型,我得到了准零系数: Call: rlm(formula = Y ~ X1 + X2 + X3 + X4, data = mymodel, maxit = 50, na.action = na.omit) Residuals: Min 1Q Median 3Q Max -7.981e+01 -6.022e-03 -1.696e-04 8.458e-03 7.706e+01 Coefficients: Value Std. Error t value (Intercept) 0.0002 0.0001 1.8418 X1 0.0004 0.0000 13.4478 X2 -0.0004 …

2
生成三个相关的均匀分布的随机变量
假设我们有 X1∼unif(n,0,1),X1∼unif(n,0,1),X_1 \sim \textrm{unif}(n,0,1), X2∼unif(n,0,1),X2∼unif(n,0,1),X_2 \sim \textrm{unif}(n,0,1), 其中unif(n,0,1)unif(n,0,1)\textrm{unif}(n,0,1)是大小均匀的随机样本n,和 Y=X1,Y=X1,Y=X_1, Z=0.4X1+1−0.4−−−−−−√X2.Z=0.4X1+1−0.4X2.Z = 0.4 X_1 + \sqrt{1 - 0.4}X_2. 那么,YYY和的相关性ZžZ为0.40.40.4。 如何将其扩展到三个变量:X1X1个X_1,X2X2X_2,X3X3X_3?

2
通过掷硬币来组合分类器
我正在学习机器学习课程,并且讲义幻灯片包含的信息与我推荐的书不符。 问题如下:存在三个分类器: 分类器A在较低的阈值范围内提供更好的性能, 分类器B在较高的阈值范围内提供更好的性能, 分类器C我们通过翻转p硬币并从两个分类器中进行选择来获得什么。 从ROC曲线上看,分类器C的性能如何? 演讲幻灯片指出,只需翻转硬币,我们就可以得到分类器A和B的ROC曲线的神奇“ 凸包 ”。 我不明白这一点。仅仅通过掷硬币,我们如何获得信息? 演讲幻灯片 这本书怎么说 推荐的书(《数据挖掘...》,作者:伊恩·H·威腾(Ian H. Witten),艾比·弗兰克(Eibe Frank)和马克·A。另一方面,)指出: 要看到这一点,请为方法A选择一个特定的概率临界值,分别给出真实的和错误的正比率tA和fA,为方法B选择另一个临界值,给出tB和fB。如果您以概率p和q随机使用这两种方案,其中p + q = 1,那么您将获得p的真假率。tA + q tB和p。fA + q fB。这表示位于连接点(tA,fA)和(tB,fB)的直线上的点,并且通过改变p和q可以找出这两个点之间的整条线。 以我的理解,这本书所说的是要真正获得信息并到达凸包,我们需要做的事情比简单地抛掷p硬币还要先进。 AFAIK,正确的方法(如书中所建议的)如下: 我们应该找到分类器A的最佳阈值Oa 我们应该找到分类器B的最佳阈值Ob 将C定义如下: 如果t <Oa,则将分类器A与t一起使用 如果t> Ob,则将分类器B与t一起使用 如果Oa <t <Ob,则用概率作为我们在Oa和Ob之间的线性组合,在带Oa的分类器A和带Ob的B之间进行选择。 它是否正确?如果是,则与幻灯片建议的内容有一些主要差异。 这不是简单的掷硬币,而是一种更高级的算法,该算法需要根据我们所处的区域手动定义点和拾取。 它永远不会使用阈值介于Oa和Ob之间的分类器A和B。 你能给我解释一下这个问题,什么是正确的理解方式,如果我的理解是不正确的? 如果我们像幻灯片所示那样简单地翻转p硬币,将会发生什么?我认为我们会得到一个介于A和B之间的ROC曲线,但是在给定的点上永远不会比更好的ROC曲线“更好”。 据我所知,我真的不理解幻灯片的正确性。左侧的概率计算对我来说没有意义。 更新: 找到了发明凸包方法的原始作者写的文章:http : //www.bmva.org/bmvc/1998/pdf/p082.pdf

2
时间序列和异常检测
我想建立一种算法来检测时间序列中的异常,并且我打算为此使用聚类。 为什么我应该使用距离矩阵而不是原始时间序列数据进行聚类?, 为了检测异常,我将使用基于密度的聚类(一种作为DBscan的算法),在这种情况下行得通吗?是否有在线版本的流数据? 我想在异常发生之前就对其进行检测,因此,使用趋势检测算法(ARIMA)是一个不错的选择吗?

2
如何使用非线性模型测试分组变量的效果?
我有一个关于在非线性模型中使用分组变量的问题。由于nls()函数不允许使用因子变量,因此我一直在努力确定是否可以测试因子对模型拟合的影响。我在下面提供了一个示例,在该示例中,我希望将“季节性von Bertalanffy”生长模型拟合到不同的生长处理方法(最常用于鱼类生长)。我想测试鱼生长的湖以及所给食物的效果(仅是一个人工例子)。我对这个问题的解决方法很熟悉-应用F检验比较模型对汇总数据的拟合与Chen等人概述的单独拟合。(1992)(ARSS-“残差平方和的分析”)。换句话说,对于以下示例, 我想有一种使用nlme()在R中执行此操作的简单方法,但是我遇到了问题。首先,通过使用分组变量,自由度高于我对单独模型的拟合所获得的自由度。其次,我无法嵌套分组变量-我看不出问题出在哪里。非常感谢使用nlme或其他方法的任何帮助。以下是我的人工示例的代码: ###seasonalized von Bertalanffy growth model soVBGF <- function(S.inf, k, age, age.0, age.s, c){ S.inf * (1-exp(-k*((age-age.0)+(c*sin(2*pi*(age-age.s))/2*pi)-(c*sin(2*pi*(age.0-age.s))/2*pi)))) } ###Make artificial data food <- c("corn", "corn", "wheat", "wheat") lake <- c("king", "queen", "king", "queen") #cornking, cornqueen, wheatking, wheatqueen S.inf <- c(140, 140, 130, 130) k <- c(0.5, 0.6, 0.8, …
15 r  mixed-model  nls 

1
何时/何处使用功能数据分析?
我是很新的功能性数据分析(FDA)。我在读: Ramsay,James O.和Silverman,Bernard W.(2006年),Functional Data Analysis,第二版,纽约,Springer。 但是,我仍然不清楚在哪里/何时使用FDA?有人可以给我一个例子,特别是在医学研究方面吗?我真的不知道在哪里/什么时候在实践中应用FDA。 对于增长曲线数据,我们可以使用非线性混合模型,对于纵向数据,我们可以使用重复测量方差分析,对于多元数据/高维数据,我们可以使用PCA,FA等。因此,何时/何地是最佳时机/使用FDA的情况?

4
测试时间序列在统计上的显着差异?
我有两个证券A和B在相同时间段内以相同频率采样的时间序列。我想测试两个价格之间在时间上是否存在统计上的显着差异(我的零假设是差异为零)。具体来说,我使用价格差异作为市场效率的代理。想象一下,A和B是有价证券及其综合等价物(即,两者都声称拥有完全相同的现金流量)。如果市场有效,则两者的价格应完全相同(除非交易成本不同,等等),或者价格差为零。这就是我要测试的。最好的方法是什么? 我可能已经在“差异”时间序列(即AB时间序列)上直观地进行了双向t检验,并测试了 = 0。但是,我怀疑可能会有更强大的测试,其中考虑了潜在的同方差或异常值。总的来说,使用证券价格时需要注意什么?μ0μ0\mu_0

2
“引导程序验证”(又称为“重采样交叉验证”)的程序是什么?
“ Bootstrap验证” /“重新采样交叉验证”对我来说是新手,但对此问题的答案进行了讨论。我收集到的数据涉及2种类型的数据:真实数据和模拟数据,其中通过替换重采样从真实数据生成给定的一组模拟数据,直到模拟数据的大小与真实数据相同。我可以想到两种使用此类数据类型的方法:(1)一次拟合模型,对许多模拟数据集进行多次评估;(2)使用许多模拟数据集中的每一个对模型进行多次拟合,每次针对实际数据进行评估。哪个(如果有)最好?

3
使用R可视化损耗的最佳方法?
通过该站点,我最近发现了Sankey Diagrams,这是一种可视化传统流程图中发生的事情的好方法。 这里是一个热平衡图的一个很好的例子乔治·怀特塞兹和乔治·W·克拉布特里, 来源; 不要忘记能源,科学的长期基础研究 2007年2月9日:第一卷。315.没有 5813,第796-798页。 意识到没有Sankey R-package之后,我在网上找到了R脚本,但不幸的是,该脚本相当原始并且有些局限。寄予厚望的我在stackoverflow上要求使用Sankey R-package或更成熟的功能,但令我惊讶的是,由于我们没有在R中构建Sankey Diagrams的成熟功能。 在我发布赏金之后,Geek On Acid足够好,可以建议对现有脚本进行一些小小的改动,使其可以或多或少地用于我的特定目的。 改进的R脚本生成了该图, Source;stackoverflow.com。 但是,缺少R软件包是否表明Sankey Diagrams并不是一种在数据流中使用R可视化损耗的惊人方法,就像上图中所示的那样(请参阅初始stackoverflow问题以获取数据和R代码。也许有一种更好的可视化损耗的方法。 您认为使用R可视化数据流中损耗的最佳方法是什么?

1
如何获得黄土拟合的R平方?
如何计算R 和/或函数输出的R平方()统计量?例如,此数据:r2r2r^2loesspredict cars.lo <- loess(dist ~ speed, cars) cars.lp <- predict(cars.lo, data.frame(speed = seq(5, 30, 1)), se = TRUE) cars.lp有两个fit用于模型和se.fit标准误差的数组。
15 r  r-squared  loess 

3
如何在R中扩展数据帧
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我在用R做一些分析时遇到以下问题。 我有一个这样的数据框: Name | Group | Count Person 1 | A | 3 Person 2 | A | 1 Person 3 | A | 0 Person 1 | B | 5 Person 2 | B | 0 Person 3 | B | 1 Person 1 | C | 1 …
15 r 

2
如何在不同的
我想到了以下提出的调整后的R平方公式: 以西结(1930),我相信这是目前SPSS中使用的一种。 R2adjusted=1−(N−1)(N−p−1)(1−R2)Radjusted2=1−(N−1)(N−p−1)(1−R2)R^2_{\rm adjusted} = 1 - \frac{(N-1)}{(N-p-1)} (1-R^2) 奥尔金和普拉特(1958) R2unbiased=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)Runbiased2=1−(N−3)(1−R2)(N−p−1)−2(N−3)(1−R2)2(N−p−1)(N−p+1)R^2_{\rm unbiased} = 1 - \frac{(N-3)(1-R^2)}{(N-p-1)} - \frac{2(N-3)(1-R^2)^2}{(N-p-1)(N-p+1)} 在什么情况下(如果有)我应该更喜欢“调整”而不是“无偏”?R2R2R^2 参考文献 Ezekiel,M.(1930年)。相关分析方法。纽约约翰·威利父子。 奥尔金(Olkin I.),普拉特(Pratt)JW(1958)。某些相关系数的无偏估计。数理统计年鉴,29(1),201-211。

1
估算器的符号(波浪号与帽子)
1.统计中是否有关于帽子和代字号的命名约定?我发现β被描述为一个估计β(维基百科),但我也发现了〜β被描述为一个估计β(钨)。含义有什么不同吗? 在Web上,我发现有所不同,但对于“统计符号”的含义我不确定。此处,在“参数估计”和“变量估计”之间进行区分。有人能解释在哪种情况下使用代字号和帽子吗? β^β^\hat{\beta}ββ\betaβ~β~\tilde{\beta}ββ\beta 2.关于期望运算符,关于括号,以及E [ X ]和E { X }有什么区别吗?我得到了使用大括号的建议。但是我不确定其含义。我以前只将括号用于阅读/可视化,而不是指出某些含义。有什么建议吗?E(X)E(X)E(X)E[X]E[X]E[X]E{X}E{X}E\{X\}
15 notation 

5
我可以忽略线性模型中非重要因素水平的系数吗?
在这里寻求关于线性模型系数的澄清之后,我有一个关于因子水平系数的非有效值(高p值)的后续问题。 示例:如果我的线性模型包含一个具有10个水平的因子,并且其中只有3个水平具有与之相关的显着p值,那么当使用该模型预测Y时,如果受试者属于以下情况之一,我可以选择不包括系数项:非重要级别? 更彻底地讲,将7个不重要的级别合并为一个级别并重新分析是错误的吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.