统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
用R分析风数据
嗨,我正在分析风数据以估算风力涡轮机的能量。 我已经收集了10年的风力数据并绘制了直方图。 我的第二阶段是将Weibull分布拟合到数据。 我将R与包装lmom一起使用以计算Weibul形状并缩放,这是我使用的代码: >library(lmom) wind.moments<-samlmu(as.numeric(pp$WS)) moments<-pelwei(wind.moments) x.wei<-rweibull(n=length(pp$WS), shape=moments["delta"], scale=moments["beta"]) hist(as.numeric(pp$WS), freq=FALSE) lines(density(x.wei), col="red", lwd=4) 数据和密度函数之间似乎有些滞后。你能帮我吗?另一个问题是您可以帮助我根据密度函数计算年能量吗? 谢谢
12 r  distributions 

4
设置Sweave,R,Latex,Eclipse StatET [关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 3年前关闭。 几天前,我看到了一篇有关如何设置SweaveR的文章,该文章使用户可以将表格,图形等内容直接导出到Latex中。我不能完全按照指示进行。 任何人都可以在Mac和Windows上逐步说明如何执行此操作吗?
12 r 

2
剖分方差分析:R中的模型比较测试
如何使用R中的X和M参数使用合适的模型比较来测试分割图方差分析中的效果anova.mlm()?我熟悉?anova.mlmDalgaard(2007)[1]。不幸的是,它只能刷分割图设计。在具有两个受试者内部因素的完全随机设计中进行此操作: N <- 20 # 20 subjects total P <- 3 # levels within-factor 1 Q <- 3 # levels within-factor 2 DV <- matrix(rnorm(N* P*Q), ncol=P*Q) # random data in wide format id <- expand.grid(IVw1=gl(P, 1), IVw2=gl(Q, 1)) # intra-subjects layout of data matrix library(car) # for Anova() fitA …

2
我怎么知道选择哪种参数估计方法?
那里有很多用于参数估计的方法。MLE,UMVUE,MoM,决策理论等似乎都具有合理的理由说明为什么它们可用于参数估计。是任何一种方法都比其他方法更好,还是仅取决于我们如何定义“最佳拟合”估计量(类似于最小化正交误差如何与普通最小二乘法产生不同的估计值)?

2
单个变量中80%的丢失数据
我的数据中有一个变量有80%的缺失数据。由于不存在(即公司欠多少银行贷款)而导致数据丢失。我碰到一篇文章,说伪变量调整方法是解决此问题的方法。这意味着我需要将此连续变量转换为分类变量吗? 这是唯一的解决方案吗?从理论上讲,我不想删除该变量,这对我的研究问题很重要。


2
阳性和阴性预测值的统计检验
我读了一篇论文,看到一张桌子,上面有PPV(正预测值)和NPV(负预测值)之间的比较。他们为他们做了某种统计检验,这是表格的示意图: PPV NPV p-value 65.9 100 < 0.00001 ... 每行都引用一个特定的列联表。 他们做了什么样的假设检验?谢谢!

1
过滤数据框
仍在学习R中的基本功能,子集功能似乎仅基于基于单个列的条件(有或没有多个条件)进行过滤? 如何轻松地从数据框中过滤数据? 当您有多个条件时 需要在可用列之间应用条件时。 示例:给定一个数据框,其中包含 name D1 D2 D3 D4 julius "A" "A" "B" "B" cate "D" "E" "A" "C" karo "A" "D" "C" "E" 说我想过滤此数据帧,以便仅命名D1到D4中的任何一个为'E'的名称, name D1 D2 D3 D4 cate "D" "E" "A" "C" karo "A" "D" "C" "E" 假设D1可能是一大列列,执行此过滤器的推荐方法是什么?谢谢
12 r 

2
Akinator.com和朴素贝叶斯分类器
上下文:我是一名程序员,在单门课程的统计方面有一些(被遗忘的)经验。最近,我偶然发现了http://akinator.com,并花了一些时间尝试使其失败。谁不是?:) 我决定找出它是如何工作的。在查阅并阅读了相关的博客文章并将一些(有限的)知识添加到结果组合中之后,我想到了以下模型(我确定我会使用错误的符号,请不要为此而杀了我): 有主题(S)和问题(Q)。预测器的目的是在给定的问题和答案的情况下,选择具有最大后验概率成为用户正在考虑的主题的主题S。 让游戏G为一系列问题和给出的答案:。{q1,a1},{q2,a2}...{qn,an}{q1,a1},{q2,a2}...{qn,an}\{q_1, a_1\}, \{q_2, a_2\} ... \{q_n, a_n\} 然后,预测变量正在寻找。P(S|G)=P(G|S)∗P(S)P(G)P(S|G)=P(G|S)∗P(S)P(G)P(S|G) = \frac{P(G|S) * P(S)}{P(G)} 主题的先验值(P(S)P(S)P(S))可以是猜测主题的次数除以游戏总数。 假设所有答案都是独立的,给定游戏G,我们可以计算出主题S的可能性,如下所示: P(G|S)=∏i=1..nP({qi,ai}|S)P(G|S)=∏i=1..nP({qi,ai}|S)P(G|S) = \prod_{i=1..n} P(\{q_i, a_i\} | S) 如果我们跟踪当使用了给定主题时给出了哪些问题和答案,我们可以计算:P({qi,ai}|S)P({qi,ai}|S)P(\{q_i, a_i\} | S) P(q,a|S)=answer a was given to question q in the game when S was the subjectnumber of times q was asked in the …

3
了解SVM回归:目标函数和“平坦度”
用于分类的SVM对我而言具有直觉的意义:我知道如何最小化||θ||2||θ||2||\theta||^2产生最大余量。但是,我不了解回归的目标。各种文本(此处和此处)将其描述为最大化“平坦度”。我们为什么要这样做?回归等于“保证金”的概念是什么? 这里有一些尝试的答案,但是没有一个真正帮助我理解。
12 regression  svm 


3
来自离散顺序反应的因子得分
有序离散变量时,有没有一种原则上的方法来估算因子得分。 我有序数,离散变量。如果我假设每个响应的基础是一个连续的,正态分布的变量,那么我可以计算一个n × n的多色相关矩阵。然后,我可以对该矩阵进行因子分析,并获取每个变量的因子负荷。nnnn×nn×nn\times n 我如何结合因素负荷和变量来估计因素得分。估算分数的典型方法似乎要求我将序数数据视为间隔。 我想我可能需要更深入地研究多元关联,以找出链接函数。

2
如何对带有随机斜率的混合效应回归模型进行MCMC假设检验?
库languageR提供了一种方法(pvals.fnc),可以使用lmer在混合效果回归模型拟合中对固定效果进行MCMC重要性测试。但是,当lmer模型包含随机斜率时,pvals.fnc会给出错误。 有没有办法对此类模型进行MCMC假设检验? 如果是这样,怎么办?(要被接受,答案应该在R中有一个可行的示例)。如果没有,是否存在无法解决的概念/计算原因? 这个问题可能与此有关,但我对其中的内容了解得不够清楚。 编辑1:概念证明表明pvals.fnc()仍然对lme4模型执行“某些操作”,但对于随机斜率模型则不执行任何操作。 library(lme4) library(languageR) #the example from pvals.fnc data(primingHeid) # remove extreme outliers primingHeid = primingHeid[primingHeid$RT < 7.1,] # fit mixed-effects model primingHeid.lmer = lmer(RT ~ RTtoPrime * ResponseToPrime + Condition + (1|Subject) + (1|Word), data = primingHeid) mcmc = pvals.fnc(primingHeid.lmer, nsim=10000, withMCMC=TRUE) #Subjects are in both …

8
统计员是做什么的?
当我告诉我的非统计学朋友时,我是攻读统计学博士学位的研究生,他们自然会说:“哦,你想当教授吗?”。我告诉他们,不,我实际上打算在工业上工作。然后他们回答:“做什么?”。对于这个问题,我没有找到好的答案。我想给他们提供统计学家正在研究的一系列有趣的问题,但是我的回答通常很混乱或过于技术化。我认为大多数人都以为我们表现出色,并计算均值和标准差。 对于这个简短而有趣的问题,有什么好的答案? 谢谢!(不确定这个问题有什么好的现有标签)
12 careers 


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.