统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
结果变量的多重插补
我有一个关于农业试验的数据集。我的反应变量是一个反应比率:log(治疗/对照)。我对调解差异的原因很感兴趣,因此我正在运行RE元回归(未加权,因为很明显效果大小与估计方差无关)。 每个研究报告谷物产量,生物量产量或两者。我无法从仅报告生物量产量的研究中得出谷物的产量,因为并非所有研究的植物都对谷物有用(例如,包括甘蔗)。但是每一种产生谷物的植物也都有生物量。 对于缺少的协变量,我一直在使用迭代回归插补(遵循安德鲁·盖尔曼的教科书章节)。它似乎给出了合理的结果,并且整个过程通常是直观的。基本上,我预测缺失值,并使用这些预测值预测缺失值,并遍历每个变量,直到每个变量近似收敛(分布)。 有什么原因使我无法使用相同的过程来估算缺失的结果数据?给定谷类响应比,作物类型和我拥有的其他协变量,我可能可以为生物量响应比形成一个相对有用的估算模型。然后,我将对系数和VCV求平均值,并按照标准做法添加MI校正。 但是,当推算结果本身时,这些系数将如何衡量?协变量的系数解释是否与标准MI有所不同?考虑一下,我无法说服自己这行不通,但我不确定。欢迎阅读材料的想法和建议。

3
线性混合模型的说明图是什么?
假设您在统计部门的图书馆中,并且您发现一本书的首页带有以下图片。 您可能会认为这是一本关于线性回归的书。 将使您想到线性混合模型的图是什么?

2
使用神经网络进行证券交易
我进入了神经网络领域,并被它们所吸引。 我终于开发出了一个用于在证券交易所测试交易系统的应用程序框架,现在我将在其中实现我的第一个神经网络。非常简单原始的一种,不适合真正的交易,仅适合初学者。 我只想知道我的方法是否是好的方法。 而且,如果您发现我遗漏了某些东西(或者我在某些方面错了),或者您对在市场交易的神经网络领域的初学者有什么帮助的想法,那将令我非常高兴:) 我有40个来自证券交易所的市值输入(S&P e-mini,但这并不重要)。 对于这40个输入,我知道2个数字。 购买订单会赚多少钱 我卖出一张订单会赚多少钱 由于证券交易所的运作方式,两个数字实际上都可能为负/正,表示我可以通过买卖来赚钱/赚钱(这是因为交易可以附加“亏损限制”或“目标”订单,如止损,限价等等)。 但是,如果发生这种情况,则表明即使买入和卖出两个订单均给出正数,我也都不应下订单。 我想最好用的激活函数是...乙状结肠,但范围是-1到1(我发现它在互联网上被称为很多名字...双极乙状结肠,tanh,切线等...我不是高深的数学家)。 通过反向传播学习,我告诉网络对于40个输入,有1个输出,此输出是这些数字之一。 -1表示卖单要赚钱,买单要亏钱 +1表示买单将要赚钱,卖出将要亏钱 0表示买入和卖出都将卖出/卖出钱,最好避免交易 我在想,学习之后,网络输出将始终是接近-1、1或0的某个数字,这取决于我设定买卖门槛的情况。 这是使用神经网络的正确方法吗? 在互联网上的任何地方,用于学习的人所得到的输出都是反向传播学习机,它是市场图表的未来价值,而不是不同交易条目(买入或卖出)的预期货币收益。我认为这种方法不好,因为我对未来的图表价值不感兴趣,但对我想赚的钱不感兴趣。 编辑:我打算建立一个用于自动交易的神经网络,而不是用于决策帮助。

1
我想根据新闻报道建立犯罪指数和政治动荡指数
我有一个辅助项目,在这里我可以爬行我所在国家的本地新闻网站,并希望建立犯罪指数和政治动荡指数。我已经介绍了该项目的信息检索部分。我的计划是: 无监督主题提取。 近重复检测。 受监督的分类和事件级别(犯罪/政治-高/中/低)。 我将使用python和sklearn,并且已经研究了可用于这些任务的算法。我认为2.可能会使我联想到一个故事的相关性:有关某个故事或主题的新闻报道越多,当天的相关性就越高。 我的下一步是根据我拥有的功能构建每月,每周和每天的索引(全国范围内和每个城市),由于“不稳定敏感性”可能会随着时间的推移而增加,我在这里有点迷失了。我的意思是,去年重大动荡事件的指数可能小于今年的指数。另外,是否使用0-100的固定刻度。 稍后,我希望能够以此为基础来预测事件,例如,过去几周的事件接连是否导致重大事件。但是现在,我将很高兴让分类生效并建立索引模型。 我将不胜感激任何指向论文,相关阅读或思想的指针。谢谢。 PD:很抱歉,这个问题不属于这里。 更新:我还没有“做到这一点”,但是最近有一个新闻,关于一群科学家正在使用新闻档案系统预测事件的系统中发表了一篇新闻,并发表了相关论文《挖掘网络来预测未来事件》(PDF )。

2
是否有用于演示的统计图的样式指南?
我正在寻找有关如何为演示文稿最佳设置图形格式的建议/资源/建议。根据经验,我知道为印刷出版物制作的图形在使用投影仪显示时不会很好地“缩放”。文本通常太小,线条不够粗等。将.eps / .pdf文件直接放入演示文稿中几乎总是一个坏主意。 使用投影仪向广大观众展示图表时,是否有推荐的风格指南?

2
在基于计算机的实验/模拟中残差的独立性?
我对适合古科学中使用的特定类型模型的不同方法进行了基于计算机的评估。我的训练集很大,因此我随机(分层随机抽样)留出了测试集。我为训练集样本拟合了mmm种不同的方法,并使用mmm结果模型预测了测试集样本的响应,并针对测试集中的样本计算了RMSEP。这是一次运行。 然后,我多次重复此过程,每次我通过随机采样新的测试集来选择不同的训练集。 完成此操作后,我想研究mmm种方法中的任何一种是否具有更好或更差的RMSEP性能。我还想对成对方法进行多次比较。 我的方法是拟合线性混合效果(LME)模型,并为Run提供单个随机效果。我使用lmer()了lme4软件包中的数据,以适应multcomp软件包中的模型和函数,以执行多次比较。我的模特本质上是 lmer(RMSEP ~ method + (1 | Run), data = FOO) 其中method是一个因素,指示用于生成测试集的模型预测的哪种方法,并且Run是每个特定运行的指标 “实验”的。 我的问题是关于LME的残差。给定运行的单个随机效应我假设该的RMSEP值在某种程度上相关,但在运行之间不相关,这是基于随机效应所提供的诱导相关性。 运行之间的独立性这一假设有效吗?如果不是,那么在LME模型中是否可以解决这个问题,还是我应该寻求采用其他类型的静态分析来回答我的问题?

1
两个独立随机变量(正态和卡方)乘积的pdf
如果X和Y是独立的,则两个独立的随机变量X和Y的乘积的pdf是多少?X是正态分布,Y是卡方分布。 Z = XY 如果XXX具有正态分布X∼N(μx,σ2x)X∼N(μx,σx2)X\sim N(\mu_x,\sigma_x^2) fX(x)=1σx2π−−√e−12(x−μxσx)2fX(x)=1σx2πe−12(x−μxσx)2f_X(x)={1\over\sigma_x\sqrt{2\pi}}e^{-{1\over2}({x-\mu_x\over\sigma_x})^2} 和YYY具有卡方分布自由度 whre是单位阶跃函数。kkkY∼χ2kY∼χk2Y\sim \chi_k^2 fY(y)=y(k/2)−1e−y/22k/2Γ(k2)u(y)fY(y)=y(k/2)−1e−y/22k/2Γ(k2)u(y)f_Y(y)={y^{(k/2)-1}e^{-y/2}\over{2^{k/2}\Gamma({k\over2})}}u(y)u(y)u(y)u(y) 现在,如果X和Y独立,则的pdf 是多少?ZZZXXXYYY 找到解决方案的一种方法是使用Rohatgi的著名结果(1976,p.141),如果fXY(x,y)fXY(x,y)f_{XY}(x,y)是连续RV XXX和Y的联合pdf YYY,则Z的pdf ZZZ是 fZ(z)=∫∞−∞1|y|fXY(zy,y)dyfZ(z)=∫−∞∞1|y|fXY(zy,y)dyf_Z(z) = \int_{-\infty}^{\infty}{{1\over|y|}f_{XY}({z\over y},y)dy} 由于和是独立的 我们面临解决积分。谁能帮助我解决这个问题。ÿ ˚F X Ý(X ,ÿ )= ˚F X(X )˚F Ý(Ý )˚F Ž(ż )= ∫ ∞ - ∞ 1XXXYYYfXY(x,y)=fX(x)fY(y)fXY(x,y)=fX(x)fY(y)f_{XY}(x,y)=f_X(x)f_Y(y) fZ(z)=∫∞−∞1|y|fX(zy)fY(y)dyfZ(z)=∫−∞∞1|y|fX(zy)fY(y)dyf_Z(z) = \int_{-\infty}^{\infty}{{1\over|y|}f_{X}({z\over y})f_{Y}(y)dy} ∫∞01fZ(z)=1σx2π−−√12k/2Γ(k2)∫∞01|y|e−12(zy−μxσx)2y(k/2)−1e−y/2dyfZ(z)=1σx2π12k/2Γ(k2)∫0∞1|y|e−12(zy−μxσx)2y(k/2)−1e−y/2dyf_Z(z) = {1\over\sigma_x\sqrt{2\pi}}{1\over{2^{k/2}\Gamma({k\over2})}}\int_{0}^{\infty}{{1\over|y|}e^{-{1\over2}({{z\over y}-\mu_x\over\sigma_x})^2} {y^{(k/2)-1}e^{-y/2}}dy} ∫∞01|y|e−12(zy−μxσx)2y(k/2)−1e−y/2dy∫0∞1|y|e−12(zy−μxσx)2y(k/2)−1e−y/2dy\int_{0}^{\infty}{{1\over|y|}e^{-{1\over2}({{z\over …

3
R中的零膨胀负二项式混合效应模型
是否有提供R中零膨胀负二项式混合效应模型估计的软件包? 我的意思是: 零充气,您可以在其中为零充气指定二项式模型,例如pscl包中的功能zeroinfl: zeroinfl(y〜X | Z,dist =“ negbin”) 其中Z是零通胀模型的公式; 模型计数部分的负二项式分布; 指定的随机效果类似于软件包lme4的功能lmer。 我知道glmmADMB可以做所有的事情,除了不能指定零通货膨胀的公式(这只是一个截距,即Z仅为1)。但是还有其他软件包可以做到吗? 我将非常感谢您的帮助!

2
列联表的筛子/镶嵌图的替代品
我曾经偶然发现过一种我非常喜欢的用于Internet上分类数据(即列联表)的图表,但是我再也找不到了,甚至不知道它叫什么。它本质上就像一个筛图,因为行高和列宽是相对于边际概率缩放的。因此,将每个框缩放到独立时预期的相对频率。但是,它与筛网图的不同之处在于,它不是在每个框内绘制交叉影线,而是在每个观测值的双变量均匀变量中随机选择的位置绘制了一个点(类似于散点图)。这样,点的密度反映了观察到的计数与预期计数的匹配程度。也就是说,如果每个框中的密度都相似,则空模型是合理的,我,Ĵ一世,Ĵi,j)在空模型下可能不太可能。因为是绘制点而不是阴影线,所以绘制的元素与观察到的计数之间存在简单直观的对应关系,对于筛网图不一定是正确的(见下文)。此外,点的随机放置使绘图具有“有机”感觉。此外,颜色可用于突出显示与零模型有很大差异的框/单元格,并且图矩阵可用于检查许多不同变量之间的成对关系,因此可以结合相似图的优点。 有谁知道这个阴谋叫什么? 是否有可以在R或其他软件(例如Mondrian)中轻松实现此功能的软件包/功能? 我在vcd中找不到类似的东西。当然,从头开始可能很难对其进行编码,但这会很痛苦。 这是一个筛分图的简单示例,请注意,很容易看出在空模型下不同类别的预期计数应如何发挥作用,但很难将交叉影线与实际数字相协调,从而产生了一个不相当容易阅读并且在美学上很丑陋: B ~B A 38 4 ~A 3 19 就其价值而言,镶嵌图具有相反的问题:尽管更容易查看哪些单元格具有“太多”或“太少”的计数(相对于null模型),但更难于识别出它们之间的关系。预期数会是。具体来说,列宽是相对于边际概率缩放的,而行高却不是,因此几乎无法提取该信息。 现在换个完全不同的东西... 有谁知道使用蓝色表示“太多”而使用红色表示“太少”的约定从何而来?这对我一直都是违反直觉的。在我看来,是非常高的密度(或太多的意见)去与热,低密度去与冷,而且(至少在舞台灯光)红色是变暖和蓝色是库尔斯。 更新: 如果我没记错的话,我看到的情节是一本书的pdf文件(简介或ch1),该书是作为市场营销预告片免费在线提供的。这是我从头开始编写的想法的粗略版本: 即使使用此粗略版本,我认为它也比筛图更易于阅读,并且在某些方面比镶嵌图更容易理解(例如,更容易识别它们之间的关系)。单元频率之间的差异将是独立的)。这将是很好的函数是:一。将使用任何列联表自动执行此操作;b。可以用作绘图矩阵的构建块,并且c。 会具有上述图所附带的出色功能(例如镶嵌图上的标准化残差图例)。

3
当只有汇总统计信息可用时,如何进行估算?
这部分是由于以下问题及其后续讨论引起的。 假设观察到iid样本。目的是估计。但是原始样品不可用。相反,我们拥有的是样本一些统计信息。假设是固定的。我们如何估算?在这种情况下,最大似然估计器是什么?θ Ť 1,。。。,Ť ķ ķ θXi∼F(x,θ)Xi∼F(x,θ)X_i\sim F(x,\theta)θθ\thetaT1,...,TkT1,...,TkT_1,...,T_kkkkθθ\theta


1
健壮的方法真的更好吗?
我有两组主题,A和B,每组的大小大约为400,预测变量大约为300。我的目标是为二进制响应变量建立预测模型。我的客户希望看到从A到B应用从A构建的模型的结果。(在他的书《回归建模策略》中,@ FrankHarrell提​​到最好将两个数据集结合起来并以此为基础构建模型,因为这样做会增加强大和精确---参见第90页,外部验证,考虑到收集我拥有的数据类型非常昂贵且耗时,我倾向于同意他的看法,但是我无法选择客户想要的东西。)我的许多预测变量都是高度相关的,而且也很偏斜。我正在使用逻辑回归来建立预测模型。 我的预测指标主要来自力学。例如,总时间的主题是一个应力比阈值高的下为时间段[ 吨1,吨2 ]中,出于各种值α &gt; 0和。显然,仅从它们的定义来看,这些总时间中有许多是代数相关的。许多与代数无关的预测变量由于其性质而相互关联:在时间段中处于高压力下的对象在时间段[ t 3,t 4趋于高压力下αα\alpha[ Ť1个,Ť2][Ť1个,Ť2][t_1, t_2]α &gt; 0α&gt;0\alpha > 0 [ 吨1,吨2 ]0 ≤ 吨1个&lt; 吨20≤Ť1个&lt;Ť20 \leq t_1 < t_2[ Ť1个,Ť2][Ť1个,Ť2][t_1, t_2],即使 [ 吨1,吨2 ] ∩ [ 吨3,吨4 ] = ∅。为了减少数据量,我将相关的预测变量聚在一起(例如,所有总应力时间都聚在一起),并使用主成分分析来表示每个聚类。由于变量存在偏差,因此我尝试了两种替代方法:[ Ť3,Ť4][Ť3,Ť4][t_3,t_4][ Ť1个,Ť2] ∩ [ t3,Ť4] = ∅[Ť1个,Ť2]∩[Ť3,Ť4]=∅[t_1,t_2] \cap [t_3,t_4] = \emptyset 在进行PCA之前,我使用了对数转换来减少变量的偏斜。 我使用了Mia …

6
检查马尔可夫链的无记忆特性
我怀疑观察到的一系列序列是马尔可夫链... X=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AAD⋮BCA⋮E⎞⎠⎟⎟⎟⎟X=(ACDDBACBAACADA⋮⋮⋮⋮⋮⋮⋮BCADABE)X=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&D &A\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & E\\ \end{array}\right) 但是,如何检查它们是否确实尊重的无记忆属性P(Xi=xi|Xj=xj)?P(Xi=xi|Xj=xj)?P(X_i=x_i|X_j=x_j)? 或者至少证明他们本质上是马尔可夫?注意,这些是根据经验观察到的序列。有什么想法吗? 编辑 只是补充,目的是从观察到的序列中比较预测的序列集。因此,我们希望您能对如何最好地进行比较提出意见。 一阶转换矩阵Mij=xij∑mxikMij=xij∑mxikM_{ij}=\displaystyle \frac{x_ij}{\sum^mx_{ik}},其中m = A..E状态 M=⎛⎝⎜⎜⎜⎜⎜⎜0.18340.46970.18270.23780.24580.30770.11360.24040.18180.17880.07690.00760.22120.06290.11730.14790.25000.19230.33570.17880.28400.15910.16350.18180.2793⎞⎠⎟⎟⎟⎟⎟⎟M=(0.18340.30770.07690.14790.28400.46970.11360.00760.25000.15910.18270.24040.22120.19230.16350.23780.18180.06290.33570.18180.24580.17880.11730.17880.2793) M=\left(\begin{array}{c c c c c c c} 0.1834& …


2
频率和先验
罗比McKilliam说,在一个评论这个职位: 应该指出的是,从常客的观点来看,没有理由不能将先验知识整合到模型中。从这个意义上讲,常客视图更简单,您只有一个模型和一些数据。无需将先验信息与模型分开 另外,@ jbowman 在这里说,常客通过成本/罚函数使用正则化,而贝叶斯算法则可以将其作为先验: 频繁的人意识到正则化是好的,并且如今已经非常普遍地使用它-贝叶斯先验可以很容易地解释为正则化。 因此,我的问题是,贝叶斯主义者通常可以将贝叶斯主义者指定为先验者的常识纳入他们的模型吗?以正则化为例,成本/罚函数是否真的集成到了模型中,或者这仅仅是调整解决方案(以及使其唯一)的纯人工方式?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.