统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么策略迭代算法会收敛到最优策略和价值函数?
我正在阅读Andrew Ng 关于强化学习的讲义,并且试图理解为什么策略迭代收敛到最优值函数和最优策略。V∗V∗V^*π∗π∗\pi^* 召回策略迭代为: 初始化 π 随机地重复{大号È 吨V :=Vπ \针对当前策略,求解贝曼方程式并将其设置为当前V大号È 吨π (s ):= a r g米一X一∈ 一∑s′P小号一(s′)五(s′)}Initialize π randomlyRepeat{Let V:=Vπ \for the current policy, solve bellman's eqn's and set that to the current VLet π(s):=argmaxa∈A∑s′Psa(s′)V(s′)} \text{Initialize $\pi$ randomly} \\ \text{Repeat}\{\\ \quad Let \ V := V^{\pi} \text{ \\for the current …

2
使用lme4的混合效应模型中交互项的P值
我正在使用lme4in来分析一些行为数据R,主要是按照Bodo Winter的出色教程进行的,但是我不理解我是否正确处理了交互。更糟糕的是,没有其他人参与到这项研究中来,因此使用混合模型,因此在确保一切正确的时候我有点不知所措。 我认为我应该尽最大的努力来解释问题,然后请求您的集体更正,而不是仅仅寻求帮助。其他一些方面是: 在写作时,我发现了这个问题,表明nlme更直接地给交互项赋予p值,但是我认为与的关系仍然有效lme4。 Livius'该问题的答案提供了许多其他阅读文章的链接,我将在接下来的几天中尝试阅读这些文章,因此,我将对所带来的任何进步进行评论。 在我的数据中,我有一个因变量dv,一个condition操作(0 =对照,1 =实验条件,应导致更高的值dv),还有一个前提条件,标记为appropriate:1为此进行编码的试验应显示出效果,但编码的试验0可能不会,因为缺少一个关键因素。 我还包括两个随机截距,分别用于subject和,用于target反映dv每个主题内以及所解决的14个问题中的每个问题的相关值(每个参与者都解决了每个问题的对照和实验版本)。 library(lme4) data = read.csv("data.csv") null_model = lmer(dv ~ (1 | subject) + (1 | target), data = data) mainfx_model = lmer(dv ~ condition + appropriate + (1 | subject) + (1 | target), data = data) interaction_model = lmer(dv ~ condition …

3
估计数据概率分布的不同非参数方法
我有一些数据,正在尝试拟合一条平滑曲线。但是,我不想对此施加太大的先验信念或过于强烈的先入之见(我的其余问题所隐含的那些除外)或任何特定的分布。 我只是想用一些平滑的曲线拟合它(或者对它可能来自的概率分布有一个很好的估计)。我知道的唯一方法是内核密度估计(KDE)。我想知道,人们是否知道其他估算此类事物的方法。我只想要它们的列表,然后就可以进行自己的研究以找出要使用的列表。 始终欢迎(并鼓励)提供任何链接或好的参考文献(或关于哪种参考文献的直觉)!

1
如何计算非线性方程的95%置信区间?
我有一个方程式可以根据海牛的年龄(以天为单位(以葡萄牙语为单位))预测海牛的体重: R <- function(a, b, c, dias) c + a*(1 - exp(-b*dias)) 我已经使用nls()在R中对其进行了建模,并得到了以下图形: 现在,我要计算95%的置信区间并将其绘制在图形中。我对每个变量a,b和c使用了上限和下限,如下所示: lower a = a - 1.96*(standard error of a) higher a = a + 1.96*(standard error of a) (the same for b and c) 然后我使用较低的a,b,c绘制较低的线,并使用较高的a,b,c绘制较高的线。但是我不确定这是否是正确的方法。它给我这张图: 这是这样做的方法,还是我做错了?

2
优势比和危险比之间是否存在功能差异?
在逻辑回归中,优势比为2意味着在预测变量增加1个单位的情况下,该事件的可能性高2倍。在Cox回归中,危险比为2意味着,如果预测变量增加一个单位,则该事件在每个时间点的发生频率将是两倍。这些实际上不是一回事吗? 如果我们可以从逻辑回归的优势比中获得功能上相同的信息,那么进行Cox回归和获得风险比的优势是什么?

1
如何衡量共识等级的可靠性(来自Kemeny-Snell书中的问题)
假设 kkk 每个专家都被要求对一组 nnn对象的顺序或偏好。让我们在排名中平分秋色。 John Kemeny和Laurie Snell在其1962年的著作“社会科学中的数学模型”中提出了解决下一个问题的建议: 项目 111。 制定衡量共识排名可靠性的方法,方法是kkk专家。例如,这可以基于通过改变单个专家的排名可以带来的最大可能的改变。(必须注意多重共识排名的可能性。)证明一些定理,关于给定值的最可靠和最不可靠的共识kkk。 本书给出了排名的注释和排名聚合的方法(即,从许多“个人”那里获得一个“集体”排名)。但是对于以上问题没有给出答案。 首先,我想到了肯德尔的WWW一致性系数,但看起来不合适。任何想法都欢迎!


3
stl或分解哪个更好?
我正在使用R进行时间序列分析。我必须将数据分解为趋势,季节和随机分量。我有3年的每周数据。我在R stl()和中发现了两个函数decompose()。我读过stl()对乘法分解不利。谁能告诉我在什么情况下可以使用这些功能?
10 r  time-series 

3
计算“实际覆盖概率”是否与计算“可信区间”相同?
我正在阅读入门级统计教科书。在关于二项式分布数据中成功比例的最大似然估计一章中,它给出了计算置信区间的公式,然后毫无保留地提及 考虑其实际覆盖率,即该方法产生捕获真实参数值的间隔的概率。这可能比标称值小很多。 并建议构建一个替代的“置信区间”,该区间可能包含实际的覆盖概率。 我第一次遇到标称覆盖率和实际覆盖率的想法。通过这里的旧问题,我想我已经理解了:有两个不同的概念,我们称为概率,第一个是尚未发生的事件将产生给定结果的可能性,第二个是观察者对已经发生的事件的结果的猜测是多么真实。似乎置信区间只测量第一种类型的概率,而所谓的“可信区间”则测量第二种类型的概率。我概括地说,置信区间是计算“名义覆盖率”的区间,可信区间是覆盖“实际覆盖率”的区间。 但是也许我对这本书有误解(尚不清楚它提供的不同计算方法是针对置信区间和可信区间,还是针对两种不同类型的置信区间),或者我曾经使用过其他资料我目前的理解。特别是我对另一个问题的评论, 置信区间为常客,贝叶斯可信 我怀疑我的结论,因为这本书没有在该章中描述贝叶斯方法。 因此,请澄清我的理解是正确的,还是我在途中犯了逻辑错误。

3
如何从Bootstrap回归中获得系数的p值?
从罗伯特·卡巴科夫(Robert Kabacoff)的Quick-R中,我有 # Bootstrap 95% CI for regression coefficients library(boot) # function to obtain regression weights bs <- function(formula, data, indices) { d <- data[indices,] # allows boot to select sample fit <- lm(formula, data=d) return(coef(fit)) } # bootstrapping with 1000 replications results <- boot(data=mtcars, statistic=bs, R=1000, formula=mpg~wt+disp) # view …

3
来自相同种群的多次采样的交集概率
这是一个示例情况: 我的人口为10,000。每个项目都有一个唯一的ID。 我随机挑选100件物品并记录ID 我把100件物品放回了人口中 我再次随机选择100个项目,记下ID并替换。 总共我重复了5次随机抽样 概率是多少 XXX 5个随机抽样中出现多少个项目? 我不是很精通统计。这是正确的吗X= 10X=10X = 10? 对于每个采样,从10,000起的100个项目的可能组合数为 b 我Ñ ø 米(10000,100)b一世ñØ米(10000,100){\rm binom}(10000, 100) 在100种商品的所有可能组合中, b 我Ñ ø 米(9990,90)* b 我Ñ ø 米(100,10)b一世ñØ米(9990,90)∗b一世ñØ米(100,10){\rm binom}(9990, 90) * {\rm binom}(100, 10) 组合包含10个特定项目 包含10个特定项目的概率为 (b 我Ñ ø 米(9990 ,90 )* b 我Ñ ø 米(100 ,10 ))/ b …

1
比例的两样本比较,样本大小估计:R vs Stata
比例的两样本比较,样本大小估计:R vs Stata 对于样本量,我得到了不同的结果,如下所示: 在R中 power.prop.test(p1 = 0.70, p2 = 0.85, power = 0.90, sig.level = 0.05) 结果: n = 160.7777ñ=160.7777n = 160.7777 (因此161)。 在Stata sampsi 0.70 0.85, power(0.90) alpha(0.05) 结果: n = 174ñ=174n = 174 每组。 为什么会有所不同?谢谢。 顺便说一句,我在SAS JMP中运行了相同的样本量计算,结果:(几乎与R结果相同)。n = 160ñ=160n = 160

4
为什么KNN不是“基于模型的”?
ESL第2.4章似乎将线性回归归类为“基于模型”,因为它假设,而k最近邻没有类似的近似值。但是,不是两种方法都假设吗?f(x)≈x⋅βf(x)≈x⋅βf(x) \approx x\cdot\betaf(x)f(x)f(x) 后来在2.4中甚至说: 最小二乘假设由全局线性函数很好地近似。f(x)f(x)f(x) k个近邻假设由局部常数函数很好地近似。f(x)f(x)f(x) KNN假设似乎也可以形式化(尽管不确定这样做是否会以假设为线性导致线性回归的方式导致 KNN算法)。fff 那么,如果KNN实际上不是基于模型的,那为什么呢?还是我误读了ESL?

1
随机森林能否比MNIST上的2.8%测试误差好得多?
我还没有发现在随机森林的应用MNIST,CIFAR,STL-10等任何文学,所以我想我会尝试将其与排列不变 MNIST自己。 在R中,我尝试: randomForest(train$x, factor(train$y), test$x, factor(test$y), ntree=500) 运行了2个小时,测试错误为2.8%。 我也试过scikit学习,与 RandomForestClassifier(n_estimators=2000, max_features="auto", max_depth=None) 70分钟后,我得到了2.9%的测试错误,但是当n_estimators = 200时,仅7分钟后我得到了2.8%的测试错误。 使用OpenCV,我尝试了 rf.train(images.reshape(-1, 28**2), cv2.CV_ROW_SAMPLE, labels.astype('int')) 运行了6.5分钟,rf用于预测给出了15%的测试误差。我不知道它训练了多少棵树,因为它们对Random Forests的Python绑定似乎忽略了该params参数,至少在版本2.3.1中如此。我也无法弄清楚如何讲清楚OpenCV的,我想解决一个分类问题,而不是回归-我有我的怀疑,因为替换astype('int')用astype('float32')的结果相同。 在神经网络中,对于不变排列的 MNIST基准,目前的技术水平是0.8%的测试错误,尽管在一个CPU上训练可能要花费2个小时以上。 是否有可能比使用随机森林的MNIST上的2.8%测试错误好得多?我认为普遍的共识是随机森林通常至少与内核SVM一样好,我相信它可以得到1.4%的测试错误。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.