统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
使用MCMC从已知密度的双变量分布中抽样
我尝试使用R中的Metropolis算法从二元密度进行模拟,但是没有运气。密度可以表示为 ,其中是Singh-Maddala分布p (X ,ÿ)p(X,ÿ)p(x,y)p (ÿ| x)p(x)p(ÿ|X)p(X)p(y|x)p(x)p (x )p(X)p(x) p(x)=aqxa−1ba(1+(xb)a)1+qp(x)=aqxa−1ba(1+(xb)a)1+qp(x)=\dfrac{aq x^{a-1}}{b^a (1 + (\frac{x}{b})^a)^{1+q}} 参数,q,b和p(y | x)是对数正态的,其中log-mean是x的分数,而log-sd是常数。为了测试我的样本是否是我想要的样本,我查看了x的边际密度,其应为p(x)。我尝试了R包MCMCpack,mcmc和dream中的不同Metropolis算法。我舍弃了老化,使用细化处理,使用了大小不超过100万的样本,但是由此产生的边际密度从来不是我提供的那种。aaaqqqbbbp(y|x)p(y|x)p(y|x)xxxxxxp(x)p(x)p(x) 这是我使用的代码的最终版本: logvrls <- function(x,el,sdlog,a,scl,q.arg) { if(x[2]>0) { dlnorm(x[1],meanlog=el*log(x[2]),sdlog=sdlog,log=TRUE)+ dsinmad(x[2],a=a,scale=scl,q.arg=q.arg,log=TRUE) } else -Inf } a <- 1.35 q <- 3.3 scale <- 10/gamma(1 + 1/a)/gamma(q - 1/a)* gamma(q) Initvrls <- function(pars,nseq,meanlog,sdlog,a,scale,q) { cbind(rlnorm(nseq,meanlog,sdlog),rsinmad(nseq,a,scale,q)) } library(dream) …

2
耶茨连续性校正2 x 2列联表
我想收集有关2 x 2列联表的Yates连续性校正领域的人们的意见。维基百科文章提到它可能会调整得太远,因此仅在有限的意义上使用。这里的相关文章没有提供更多的见解。 那么对于定期使用这些测试的人,您有何想法?使用校正是否更好? 一个真实的例子,在95%的置信水平下会产生不同的结果。请注意,这是一个作业问题,但是我们的班级根本不处理Yates的连续性校正,因此,即使您没有为我做作业,也请入睡。 samp <- matrix(c(13, 12, 15, 3), byrow = TRUE, ncol = 2) colnames(samp) <- c("No", "Yes") rownames(samp) <- c("Female", "Male") chisq.test(samp, correct = TRUE) chisq.test(samp, correct = FALSE)

3
混淆变量怎么办?
我需要做一个实验。首先让我描述一下目前的情况。我工作的公司是电影院。它有一个游戏区,在那里等待电影的人可以通过玩游戏来消磨时间。人们只能使用预付会员卡付款。不幸的是,这个游戏部门没有产生足够的销售额。我们正在寻找原因。 我的假设是,如果我们接受现金付款,销售额将会增加。 我的计划是要有实验组和对照组。实验组将接受现金付款,对照组则不接受。在实验之前和之后,两组的销售额都被计算。 困难的是,我找不到将“现金支付”因素与其他因素区分开的方法: 电影院里放映的电影不错时,会有更多的人前来,销量也将增加 每个电影院只有一个游戏区,我不能将其分成两个区(一个接受现金,另一个不接受现金) 如果几个站点接受现金而其他一些站点不接受现金,我认为我不能直接比较结果,因为访问者不同,游戏机数量也不同 我正在寻找隔离此“现金支付”变量的建议,或者可能是另一种方法。

2
我可以使用置换测试来避免比例背景下的多重比较问题吗?
我正在评估5种不同方法预测特定二进制结果(称为“成功”和“失败”)的有效性。数据如下所示: Method Sample_Size Success Percent_Success 1 28 4 0.14 2 19 4 0.21 3 24 7 0.29 4 21 13 0.61 5 22 9 0.40 我想对这5种方法进行测试,以评估这些方法的相对优势。换句话说,我想按照性能的顺序对方法进行排序,方法是方法1>方法2> ...方法5。为避免出现多个比较的问题,我计划按照以下几行进行置换测试: 步骤1:汇总所有数据,以使总样本量为114,共获得37次成功。 步骤2:将数据随机分为5组,相应的样本大小分别为28、19、24、21和22。 步骤3:如果从步骤2中观察到的Percent_Success顺序与我的数据顺序一致,则增加一个计数器。 步骤4:重复步骤2和3多次(例如10000)。 所需的p值=最终计数器值/ 10000。 问题: 以上程序可以吗? R中有什么可以让我执行上述测试的吗? 任何改进或替代方法的建议都会有所帮助。

4
多向非参数方差分析
我必须分析具有​​五个因子(其中一个嵌套在另一个因子中)和数值响应的析因设计。我想执行非参数方差分析,但是我当然不能同时使用Kruskall Wallis检验和Friedman检验(我已经复制了测度)。R中是否有可以帮助我的命令或代码?谢谢!Stefania

10
您如何绘制结构方程/ MPLUS模型?
我正在寻找一种软件工具(最好是开源的)来高效,简洁地绘制结构方程/混合物模型。 在研究了xfig和graphviz之后,我现在坚持使用通用的矢量图形程序包inkscape,因为它似乎最灵活。 我想调查stat.stackexchange社区:您如何绘制结构方程/混合物模型?你用什么软件?

3
如何对时间序列进行预测?
我对时间序列数据的分析并不熟悉。但是,我有一个简单的预测任务要解决。 我从一个普通的生成过程中获得了大约五年的数据。每年代表具有非线性成分的单调递增函数。在每年的40周周期中,我每周都有计数。过程开始,函数从零开始,在函数的前半部分相当快地增加,在后半部分中变慢,然后在最后五周内变平。多年以来,这一过程是一致的,每年各个细分市场的变化率和数量差异很小。 y1={0,Nt1,Nt2,...Nt39,Nt40}y1={0,Nt1,Nt2,...Nt39,Nt40} y_{1}=\{0, N_{t1}, N_{t2}, ... N_{t39}, N_{t40}\} ⋮⋮ \vdots y5={0,Nt1,Nt2,...Nt39,Nt40}y5={0,Nt1,Nt2,...Nt39,Nt40} y_{5}=\{0, N_{t1}, N_{t2}, ... N_{t39}, N_{t40}\} 哪里 NtxNtxN_{tx} 等于时间x的计数。 目标是 NNN 在 txtxtx (或更好 t0t0t0 至 txtxtx,或指向该点的坡度)并预测 NNN 在 t40t40t40。例如,如果Nt10Nt10N_{t10} 是5000的期望值是多少 Nt40Nt40N_{t40}那年。因此,问题是,您将如何为此类数据建模?总结和可视化非常容易。但是我想要一个模型来促进预测并结合误差度量。


4
考克斯回归和时间尺度
Cox比例风险回归分析中的X(风险)变量是否始终必须是时间?如果没有,请提供一个例子吗? 癌症患者的年龄可以成为危险因素吗?如果是这样,是否可以将其解释为一定年龄的患癌风险?Cox回归是否是研究基因表达与年龄之间关联的合法分析?

7
大小不相等的两个变量之间的相关性
在我正在处理的问题中,我有两个随机变量X和Y。我需要弄清楚这两个变量之间的相关性如何,但是它们的维数不同。X的行空间的等级为4350,Y的行空间的等级实质上较大,为数万。X和Y的列数相同。 我需要测量两个变量之间的相关性,而Pearson的r要求X和Y具有相等的维数(至少R要求两个rv是)。 我是否有希望在这两者之间建立关联,还是应该找到一些方法来删减Y的观测值? EDIT 从评论中添加信息,应该在问题中。 我想我忘了提这个了。X和Y是股票价格。X公司的上市时间比Y公司短得多。我想说一下X和Y的价格之间的相关性。在X和Y都存在的一段时间内,我肯定可以得到一个相关性。我想知道是否知道X并不存在的Y的额外几年的股价为我提供了任何其他信息。

2
有没有人使用Marascuilo程序比较多个比例?
当您要在整体卡方检验中拒绝空值后,要测试哪些特定比例彼此不同时,此处描述的Marascuilo程序似乎是一种针对比例的多个比较问题的测试。 但是,我对该测试不是很熟悉。所以,我的问题是: 使用此测试时,我应该担心哪些细微差别(如果有)? 我知道至少有两种其他方法(见下文)可以解决同一问题。“更好”的方法是哪个测试? @Brett Magill 在此答案中提到的表演“分区卡方” 使用Holm–Bonferroni方法调整p值。

1
估算集的大小时出错?
假设我们有一个集合A和一个子集B。如果我们知道| A |,那么我们可以计算| B |。通过找到从A中随机选择的元素均属于B的概率p,可以找到| A | p = | B |。 假设我们随机地均匀生成A的n个元素,并使用此数据估算p(B中元素的数量除以n),从而估算| B |。 这个估计有多可靠?即我们如何计算误差? 作为附带问题,此技术是否有名称?(这似乎是标记回收技术的数学版本)

1
寻找的边际密度
如标题所示,我正在寻找的边际密度F(x ,y)= c1 -X2-ÿ2---------√,X2+ÿ2≤1 。F(X,ÿ)=C1个-X2-ÿ2,X2+ÿ2≤1。f (x,y) = c \sqrt{1 - x^2 - y^2}, x^2 + y^2 \leq 1. 到目前为止,我发现为。我通过将转换为极坐标并在积分来弄清楚,这就是为什么我被困在边际密度部分上的原因。我知道,但是我不确定如何在没有大的混乱积分的情况下解决这个问题,我知道答案是“应该是一个很大的混乱积分。是否有可能找到,然后采用来找到CCc32个π32π\frac{3}{2 \pi}F(x ,y)F(X,ÿ)f(x,y)d[R dθd[Rdθdrd\thetaFX(x )=∫∞- ∞F(x ,y)dÿFX(X)=∫-∞∞F(X,ÿ)dÿf_x(x) = \int_{-\infty}^\infty f(x,y)dyF(x ,y)F(X,ÿ)F(x,y)dFdXdFdX\frac{dF}{dx}FX(x )FX(X)f_x(x)?这似乎是一种直观的方法,但我似乎无法在教科书中找到说明这些关系的任何内容,因此我不想做出错误的假设。

5
计算正态分布的百分位数
参见此维基百科页面: http://en.wikipedia.org/wiki/Binomial_proportion_confidence_interval#Agresti-Coull_Interval 要获得Agresti-Coull间隔,需要计算正态分布的百分位数,称为 žzz。如何计算百分位数?Wolfram Mathematica和/或Python / NumPy / SciPy中是否有现成的函数可以执行此操作?

1
学习分层加固任务的结构
我一直在研究层级强化学习问题,尽管许多论文都提出了学习策略的算法,但他们似乎都假设他们事先知道了描述域中动作层次的图结构。例如,迪特里希(Dietterich)的MAXQ分层强化学习方法描述了一个简单的出租车域的动作和子任务图,但没有发现该图。您将如何学习该图的层次结构,而不仅仅是策略? 换句话说,以本文的示例为例,如果一辆出租车在没有先验知识的情况下漫无目的地行驶,并且只有原始的向左移动/向右移动等动作,它将如何学习更高级别的动作,例如去接乘客?如果我正确地理解了本文(可能不是),它会提出如何为这些高级操作更新策略,而不是从一开始就形成这些策略。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.