统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
K-均值:实际情况下有多少次迭代?
我没有数据挖掘或大数据方面的行业经验,所以很高兴听到您分享一些经验。 人们实际上在一个非常大的数据集上运行k-means,PAM,CLARA等吗?还是他们只是从中随机抽取一个样本?如果他们只是对数据集进行抽样,如果数据集不是正态分布的,结果是否可靠? 在实际情况下,运行这些算法时,我们能否说出收敛之前通常需要进行多少次迭代?还是迭代次数总是随数据大小而增长? 我之所以这样问,是因为我正在考虑开发一种在收敛之前终止迭代算法的方法,但是结果仍然可以接受。我认为值得尝试的是,如果迭代次数大于1,000,则可以节省一些计算成本和时间。你怎么看?

1
您为什么要从混合效应模型中进行预测,而又不包括随机效应呢?
这更多是一个概念性问题,但是在我使用时,R我将参考中的软件包R。如果目的是为了进行预测而拟合线性模型,然后在可能无法获得随机效应的情况下进行预测,那么使用混合效应模型有什么好处,还是应该使用固定效应模型? 例如,如果我有重量与高度数据以及其他一些信息,并且使用构建以下模型lme4,其中受试者是具有因子水平(Ñ = Ñ Ö 。小号一米p 升Ë 小号ññnn = n o 。š 一米p 升Ë 小号ñ=ñØ。s一个米p升Ësn=no.samples): mod1 <- lmer(weight ~ height + age + (1|subject), data=df, REML=F) 然后,我希望能够使用新的身高和年龄数据从模型中预测体重。显然,原始数据的个体差异是在模型中捕获的,但是可以在预测中使用此信息吗?假设我有一些新的身高和年龄数据,并且想要预测体重,我可以这样做: predict(mod1,newdata=newdf) # newdf columns for height, age, subject 这将使用predict.merMod,并且我可以在newdf或set中为(新)主题添加一列re.form =~0。在第一种情况下,尚不清楚模型如何处理“新”主观因素,在第二种情况下,是否会简单地忽略(平均)模型中捕获的个体差异以进行预测? 无论哪种情况,在我看来固定效果线性模型都可能更合适。确实,如果我的理解是正确的,那么如果预测中未使用随机效应,则固定效应模型应预测与混合模型相同的值。应该是这样吗?在R它不是,例如: mod1 <- lmer(weight ~ height + age + (1|subject), data=df, REML=F) predict(mod1,newdata=newdf, …


2
调整后的兰德指数与调整后的共同信息
我正在尝试评估集群性能。我正在阅读有关metrics的skiscit-learn文档。我不了解ARI和AMI之间的区别。在我看来,他们以两种不同的方式做同样的事情。 从文档中引用: 有了基本实况类分配labels_true和我们的相同样本labels_pred的聚类算法分配的知识,调整后的兰德指数就可以衡量两个分配的相似性,而无需考虑排列和机会归一化。 与 在了解了基本事实类分配labels_true和我们的相同样本labels_pred的聚类算法分配的知识后,互信息是一个函数,用于测量两个分配的一致性,而忽略排列... AMI是最近提出的,并针对机会。 我应该在聚类评估中同时使用它们吗?还是多余?

3
语义分割的损失函数
对于滥用技术术语表示赞赏。我正在通过卷积神经网络(CNN)进行语义分割的项目;试图实现Encoder-Decoder类型的体系结构,因此输出的大小与输入的大小相同。 您如何设计标签?一个应该应用什么损失函数?尤其是在严重的类别不平衡的情况下(但是类别之间的比率在图像之间是可变的)。 该问题涉及两个类别(感兴趣的对象和背景)。我正在将Keras与tensorflow后端一起使用。 到目前为止,我将应用按像素标注将预期输出设计为与输入图像相同的尺寸。模型的最后一层具有softmax激活(针对2个类)或S型激活(表示像素属于对象类的概率)。我在为此类任务设计合适的目标函数时遇到麻烦: function(y_pred,y_true), 同意Keras的观点。 请尝试具体说明所涉及的张量的大小(模型的输入/输出)。任何想法和建议都非常感谢。谢谢 !


1
回归模型中的左侧和右侧命名法
y=β0+β1x1+ε0y=β0+β1x1+ε0y = \beta_{0} + \beta_{1}x_{1} + \varepsilon_{0} 描述回归模型的语言(例如上面指定的非常简单的线性回归)通常会发生变化,并且这种变化通常会在含义上产生细微的变化。例如,方程式左侧的模型部分可以用括号(包括我不知道的其他术语)来表示: 因变量(因果关系提示) 预测变量(暗示模型预测/进行预测) 响应变量(暗示因果关系,或至少是时间顺序) 结果变量(暗示因果关系) 命名法的变化在等式的右侧也是正确的(相同的免责声明是我对其他术语不了解): 自变量(暗示因果优先级,暗示实验设计) 预测变量(暗示预测,意味着该变量具有与之关联的非零参数估计) 在提议审查或交流研究的过程中,我不仅有机会使用一个或另一个术语来称呼它,而且后来又以我选择用它代替的术语来称呼它。虽然打电话的人当然是学徒的(注:我是专业的学徒,所以我很同情),但是由于我们所有人都知道所传达的内容,我仍然想知道: 回归模型中是否存在左,右变量的常用术语,这些术语与(a)模型的外部用途,(b)变量之间的因果关系以及(c)研究方面无关用来产生变量的设计本身? 注意:我不是在问正确建模和正确解释的重要问题(即,我非常在意因果关系,研究设计等),而是对一种语言进行一般讨论更感兴趣。 (我想我认为“左手变量”和“右手变量”可能被解释为一个可靠的答案,但是这些术语似乎很笨拙……也许这是一个笨拙的问题。:)

2
马尔可夫链的中心极限定理
\newcommand{\E}{\mathbb{E}}\newcommand{\P}{\mathbb{P}}中心极限定理(CLT)规定,对于X1个,X2,…X1,X2,…X_1,X_2,\dots独立且分布相同(iid),E [ X一世] = 0E[Xi]=0\E[X_i]=0和Var(X一世)&lt; ∞Var⁡(Xi)&lt;∞\operatorname{ Var} (X_i)<\infty,总和收敛为n \ to \ infty的正态分布n → ∞n→∞n\to\infty: ∑我= 1ñX一世→ N( 0 ,n--√)。∑i=1nXi→N(0,n). \sum_{i=1}^n X_i \to N\left(0, \sqrt{n}\right). 取而代之的是,假设X_1,X_2,\点X1个,X2,…X1,X2,…X_1,X_2,\dots形成具有期望值为0和有界方差的固定分布\ P_ \ infty的有限状态马尔可夫链P∞P∞\P_\infty。对于这种情况,是否有CLT的简单扩展? 我在CLT上找到的关于马尔可夫链的论文通常会处理更一般的情况。我将非常感谢您提供有关总体结果的说明以及如何应用的解释。

1
具有L2正则化的RNN停止学习
我使用双向RNN来检测不平衡事件的发生。积极的阶层比消极的阶层少100倍。尽管不使用正则化,但我可以在训练集上获得100%的准确性,在验证集上获得30%的准确性。我启用了l2正则化,结果在训练集上的准确度也只有30%,而不是更长的学习,而在验证集上的准确度是100%。 我当时以为我的数据可能太小了,所以只是为了进行实验,我将训练集与以前未使用的测试集合并了。情况与我使用l2正则化的情况相同,而我现在没有。我在训练+测试和验证中获得了30%的准确性。 在提到的实验中使用128个隐藏单元和80个时间步长当我将隐藏单元的数量增加到256个时,我可以再次在Train + Test Set上过拟合以达到100%的准确性,但在验证组上仍然只有30%。 我确实为超参数尝试了很多选项,但几乎没有结果。可能是加权的交叉熵引起了问题,在给定的实验中,正类的权重为5。尝试更大的权重时,结果的准确性通常会降低20%左右。 我尝试了LSTM和GRU细胞,没有区别。 我得到的最好的结果。我尝试了2个具有256个隐藏单元的隐藏层,这花了大约3天的计算时间和8GB的GPU内存。在进行l2正则化时,我再次获得了40-50%的准确度,然后又开始过度拟合,但强度不高。 我使用的是Adam优化器,其他的则效果不佳。我拥有的功能就足够了,因为在使用状态机时,我可以获得90%的精度。在该状态机中,主要特征是基于其他特征属性进行求和和阈值处理,并且其可变长度有时为10,有时为20,涉及该特征的时间戳。 在这种情况下,有一些一般性准则可以做什么?我什么都找不到。



4
从1个值播种N个独立随机数生成器的最佳方法
在我的程序中,我需要运行N个单独的线程,每个线程都有自己的RNG,该RNG用于采样大型数据集。我需要能够使用单个值为整个过程设定种子,以便能够重现结果。 仅按顺序增加每个索引的种子就足够了吗? 目前,我使用numpy的是RandomState使用Mersenne Twister伪随机数生成器的。 下面的代码片段: # If a random number generator seed exists if self.random_generator_seed: # Create a new random number generator for this instance based on its # own index self.random_generator_seed += instance_index self.random_number_generator = RandomState(self.random_generator_seed) 本质上,我从用户输入的种子(如果存在)开始,然后针对每个实例/线程,依次添加正在运行的实例的索引(从0到N-1)。我不知道这是个好习惯还是有更好的方法来做到这一点。

2
在参数模型中测试比例风险假设
我知道要在Cox PH模型的上下文中测试比例风险假设,但是我还没有遇到任何与参数模型有关的事情?有没有可行的方法来测试某些参数模型的PH假设? 似乎应该假设参数模型与半参数Cox模型仅略有不同? 例如,如果我想拟合Gompertz死亡率曲线(如下所示),应如何测试PH假设? μXHX(吨)小号X(吨)= a b e一个X + βž= ∫Ť0μX + 吨dt = b (e一个牛逼− 1 )e一个X + βž= exp ( - ħX(t ))μX=一个bË一个X+βžHX(Ť)=∫0ŤμX+ŤdŤ=b(Ë一个Ť-1个)Ë一个X+βž小号X(Ť)=经验值(-HX(Ť))\begin{align} \mu_{x}&=abe^{ax+\beta Z}\\ H_{x}(t)&=\int_{0}^{t}\mu_{x+t}\,dt=b(e^{at}-1)e^{ax+\beta Z}\\ S_{x}(t)&=\text{exp}(-H_{x}(t)) \end{align} 我总体上想问的是:对于参数生存模型,有哪些方法可以评估模型的拟合优度并测试模型的假设(如果有)? 我需要检查参数模型中的PH假设还是仅用于Cox模型?

2
概率的频繁定义;是否存在正式定义?
关于常客在“概率”下理解的内容,是否有任何正式(数学)定义。我读到这是“从长远来看”的相对发生频率,但是是否有一些正式的方法来定义它?在哪里可以找到该定义的已知参考文献? 编辑: 对于常客(请参阅@whuber的评论以及我对答案@Kodiologist和@Graeme Walsh的评论,下面的答案),我的意思是那些“相信”这种长期相对频率存在的人。也许这(部分)也回答了@Tim的问题

1
如何计算出样本R平方?
我知道这可能已经在其他地方讨论过了,但是我还没有找到明确的答案。我正在尝试使用公式计算线性回归模型的样本外,其中是残差平方的总和,而是平方总和。对于训练集,很明显R 2 S S R S S T[R2= 1 - S小号[R /小号小号Ť[R2=1个-小号小号[R/小号小号ŤR^2 = 1 - SSR/SST[R2[R2R^2小号小号[R小号小号[RSSR小号小号Ť小号小号ŤSST 小号小号Ť= ∑(y- ÿ¯吨ř 一个我Ñ)2小号小号Ť=Σ(ÿ-ÿ¯Ť[R一个一世ñ)2 SST = \Sigma (y - \bar{y}_{train})^2 那测试集呢?我应该继续使用来代替样本还是使用?ý ˉ ý吨Ë小号吨ÿ¯吨ř 一个我Ñÿ¯Ť[R一个一世ñ\bar{y}_{train}ÿÿyÿ¯牛逼Ë 小号ŧÿ¯ŤËsŤ\bar{y}_{test} 我发现如果我使用,则有时生成的可能为负。这与sklearn 函数的描述一致,他们使用(他们的linear_model 函数也使用它来测试样本)。他们指出“不管输入特征如何,始终预测y期望值的恒定模型将获得0.0的R ^ 2得分。”- [R2 ˉ ý吨Ë小号吨ÿ¯牛逼Ë 小号ŧÿ¯ŤËsŤ\bar{y}_{test}[R2[R2R^2r2_score()ÿ¯牛逼Ë 小号ŧÿ¯ŤËsŤ\bar{y}_{test}score() 但是,在其他地方,人们喜欢在这里和这里使用(dmi3kno的第二个答案)。所以我想知道哪个更有意义?任何评论将不胜感激!ÿ¯吨ř 一个我Ñÿ¯Ť[R一个一世ñ\bar{y}_{train}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.