统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
威望魔术师悖论
您可能知道电影《威望》中的技巧: [电影剪辑师]魔术师发现了一个令人印象深刻的魔术:他走进机器,关上门,然后消失并重新出现在房间的另一侧。但是机器并不完美:它不仅能传送他,还能复制他。魔术师呆在原处,并在房间的另一侧创建了副本。然后,机器中的魔术师小心翼翼地掉入地板下的水箱中,淹死了。编辑:魔术师的新副本被淹死的概率是1/2(换句话说,新副本有1/2被淹死的机会和1/2弹出房间的机会)。而且,水箱永远不会失效,掉进水箱中的魔术师死亡的机会是1。 所以魔术师真的不喜欢做这个把戏,因为“你永远不知道自己要去哪里,在房间的另一侧或被淹死”。 现在,悖论如下:想象魔术师把戏100次。他生存的机会是什么? 编辑,另外一个问题:魔术师保持他的物理大脑而没有新大脑的机会是什么? 快速分析:一方面,有一名魔术师还活着,有100名溺水的魔术师,所以他的机会是100分之一。 另一方面,每次他把戏时,他都有1/2存活的机会,所以他的机会是 (1 / 2)100= 1 /(2100)(1/2)100=1/(2100)(1/2)^{100}=1/(2^{100}) 保持生命。 正确的答案是什么,为什么?

2
如何找到图表何时达到峰值和平稳状态?
这听起来很基本,但是我有一个问题:我有一个窗口大小为300的数据队列。新数据在一端添加,旧值从另一端删除。 我希望队列数据或多或少保持一致,例如:10,12,15,10,20,然后开始急剧上升:15,10,20,22,25,26,28,30,32 ...一路上升到150左右。那里的数据可能会有所波动,然后以相似的斜率(120,118,116,115 ...)下降到20左右。 我正在尝试以编程方式确定该数据系列中的转折点,但是我的代码检测峰值的次数比我想的要多。如何确定图形何时上升,何时达到确定的转折点以及何时开始下降?我应该尝试看看变化率的变化率吗?


3
如何验证极低的错误率
我面临尝试通过测试证明传感器的错误率极低(在1,000,000次尝试中不超过1个错误)的问题。我们进行实验的时间有限,因此我们预计无法获得超过4,000次尝试。我看不出传感器不符合要求的问题,因为即使在4,000次尝试中发生一个错误,对于错误率的下限仍大于0.000001的情况,也会产生95%的置信区间。然而,表明它确实满足要求是问题,因为即使4,000次尝试中的0个错误仍然会导致下限大于0.000001。任何建议将不胜感激。

5
除了Pearson相关性之外,我还能做什么?
在检查两个变量是否相关时,我观察到应用Pearson相关得出的数字低至0.1,表明没有相关性。我能做些什么来加强这一主张? 我正在查看的数据集(由于发布限制而被细分)是这样的: 6162.178176 0.049820046 4675.14432 0.145022261 5969.056896 0.47210138 5357.506176 0.052263122 33.796224 16.45154204 6162.178176 0.064262991 6725.448576 0.419005508 3247.656192 0.867394771 5357.506176 0.052263122 3612.97728 0.091337414 6162.178176 0.053065652 867.436416 0.129116092 556.833024 1.01107509 1517.611392 168.1484478 1517.611392 35.11570899 4675.14432 0.053902079 4182.685056 0.070289777 2808.30528 0.071929502 5969.056896 0.47193385 3247.656192 0.896646636 4387.071744 0.056985619 6273.222912 0.046547047 4387.071744 0.034875199 7946.940672 0.074997414 …

2
考虑到一个具有上限的变量,应使用哪种类型的回归?
我不确定要使用哪种方法来建模两个变量之间的关系(xxx 和 yyy)在实验中的描述如下: 有3个变量: xaimxaimx_{aim}, xxx 和 yyy。 的价值 xaimxaimx_{aim}在进行实验时设置。然而,xxx 和 xaimxaimx_{aim} 并不总是相等的。 皮尔逊之间的相关系数 xaimxaimx_{aim} 和 xxx 大约是0.9。 皮尔逊之间的相关系数 xxx 和 yyy 少得多:约0.5。 yyy 具有最大可能值(ymaxymaxy_{max}),不能超过。 设置后获取每个数据点 xaimxaimx_{aim} 和阅读 xxx 和 yyy。 虽然皮尔逊之间的相关系数 xxx 和 yyy 不好,看起来像 yyy 倾向于随着 xxx。 在进行简单的线性回归之后 y=f(x)y=f(x)y=f(x) 和 x=g(y)x=g(y)x=g(y) (然后将后者转换为 g−1g−1g^{-1},以便与 fff 例如),两个斜率均为正,但 g−1g−1g^{-1} 大于 fff。 …

5
非正式/视觉“多次比较”是否需要多次比较校正?
关于何时需要进行多重比较校正,我有一个哲学问题。 我正在测量连续的时变信号(在离散时间点)。有时会发生单独的事件,我想确定这些事件是否对测得的信号有重大影响。 因此,我可以获取事件后的均值信号,通常我可以在某个峰值处看到一些效果。如果我选择了那个高峰的时间,并说出t检验来确定它是否显着,而不是什么时候不发生,我是否需要进行多次比较校正? 尽管我只进行过一次t检验(计算出1个值),但是在我最初的目视检查中,我从绘制的15个不同的后期延迟时间点中选择了具有最大潜在影响的检验。那么我是否需要对从未执行过的15个测试进行多次比较校正? 如果我不使用视觉检查,而只是在每次事件滞后都进行了测试并选择了最高的一次,那么我肯定需要更正。我是否需要根据测试本身以外的其他标准(例如,视觉选择,最高均值等)做出“最佳延迟”选择,这有点困惑

3
普通英语的Apriori算法?
我阅读了有关Apriori的Wiki文章。我在理解修剪和加入步骤时遇到了麻烦。谁能用简单的术语解释我Apriori算法的工作原理(这样像我这样的新手都可以轻松理解)? 如果有人解释其中涉及的逐步过程,那将是很好的。

3
如何从非常大的数据集中快速选择重要变量?
我有一个约有2,000个二进制变量/ 200,000行的数据集,我正在尝试预测一个二进制因变量。在此阶段,我的主要目标不是提高预测的准确性,而是确定其中哪些变量是重要的预测因子。我想将最终模型中的变量数减少到100个左右。 是否有相对快速的方法来获取最重要的变量?randomForest似乎要花费很长时间。 我不必全部使用200,000个观察值,因此采样是表上的一个选项。




2
测试组之间(某些)分位数Q的差异?
对于某些分为三个组(X)的Y变量,我希望对各组进行比较,并假设所有三个组之间90%的分位数相同。我可以使用哪些测试? 我能想到的一种选择是使用分位数回归,还有其他选择/方法吗? 我想如果我想比较中位数,就可以使用kruskal wallis检验(尽管它是基于等级的,但是如果我没记错的话,当残差分布是对称的时,它也会给出相同的结果) 谢谢。

3
时序电机数据分类的最佳算法
我正在从事机器控制项目。我们可以在运行期间测量电动机的电流。下面是来自成功执行操作的两个电机的样本数据。红色迹线显示来自一个电动机的电流,蓝色迹线显示来自另一电动机的电流。我想尝试提出一种算法来识别机器行为问题。问题可能是电动机电流过高,电动机电流接近于零,操作结束时电流增加,时间序列比正常时间短,一般而言,以下情况都不像典型操作。谁能建议一个好的算法来实现这一目标?我唯一熟悉的是神经网络。我已将实际数据的Excel文件放入电机电流下

2
允许数据决定先验条件,然后使用这些先验条件运行模型?(例如,来自同一数据集的数据驱动先验)
我的理解是,我们不应该允许我们正在分析的同一数据集来驱动/定义贝叶斯分析中的先验分布。特别是,基于来自同一数据集的摘要统计信息来定义贝叶斯分析的先验分布是不合适的,然后您将使用先验来帮助模型拟合。 有谁碰巧知道专门讨论这是不合适的资源?我需要对此问题进行一些引用。
9 bayesian  prior 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.