统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
聚类概率分布-方法和指标?
我有一些数据点,每个数据点包含5个聚集的离散结果向量,每个向量的结果都是通过不同的分布生成的(具体类型我不确定,我最好的猜测是Weibull,其形状参数在幂次幂附近变化定律(大致为1到0)。) 我正在寻找使用像K-Means这样的聚类算法,根据其5个分量分布的属性将每个数据点分组。我想知道是否有确定的距离度量标准可以很好地满足这些目的。到目前为止,我已经有了三个想法,但是我不是一个经验丰富的统计学家(更多的是一位数据挖掘计算机初学者),所以我几乎不知道自己有多远。 由于我不知道我要处理的是哪种分布,因此我的蛮力解决方法是将每个分布(每个点有5个)切成其各自的离散数据值(I pad)每个值都对应一个相同的长度,并在末尾用零表示),并将这些值中的每个用作数据点本身的单独属性。我尝试基于PDF和CDF的这些属性使用曼哈顿距离和欧几里得距离作为度量。 再一次,由于我不知道我拥有哪种分布,所以我发现,如果要测量总体分布之间的距离,则可以在分布之间使用某种非参数测试对,例如KS检验,以查找给定分布是由不同PDF生成的可能性。我认为,使用曼哈顿距离的第一个选择(以上)将是使用该方法可能获得的一种上限(因为KS统计量是CDF差的最大绝对值,其中曼哈顿距离是PDF差异的绝对值之和)。然后,我考虑了可能使用欧几里得距离,但可能仅取所有这些值中的最大值来组合每个数据点内不同的KS统计量或P值。 最后,为了尽我所能解释的分布形状,我想我可能会尝试估计分布的参数以拟合Weibull曲线。然后,我可以基于Weibull分布的两个参数lambda和k(比例和形状)的差异对分布进行聚类,可能根据这些参数的差异或某种形式进行归一化。这是我认为可能对参数进行标准化的唯一情况。 所以我的问题是,对于集群分布,您会建议什么度量/方法?我甚至在这些方面都走对了吗?K-Means甚至是使用的好算法吗? 编辑:澄清数据。 每个数据点(Obj我要集群的每个对象)实际上都包含5 vectors数据。我知道这些对象可以进入5个阶段。(为简化起见)我们将说每个向量都属于length N。 这些载体(称之为中的每一个vector i)是一个概率分布与整数x-values至N,其中每个对应的y值表示测量的概率1 value x中phase i的对象Obj。那么N是我期望在对象的任何阶段测量的最大x值(在我的分析中,这实际上不是一个固定的数字)。 我通过以下方式确定这些概率: 我拿一个Obj,并把它phase i的k trials,进行测量,在每次试验。每个度量都是一个整数。我对单个对象的5个阶段中的每个阶段都执行此操作,然后依次对每个对象执行此操作。我对单个对象的原始测量数据可能类似于: 向量1。[90、42、30、9、3、4、0、1、0、0、1] 向量2。[150,16,5,0,1,0,0,0,0,0,0] ... 矢量5。[16,... ...,0] 然后,相对于该给定向量中的测量总数,我将每个向量单独归一化。这使我在该载体中,其中每一个对应的y值表示测量的概率的概率分布value x中phase i。

2
MCMC收敛到单个值?
我正在尝试使用jags和rjags包来适应分层模型。我的结果变量是y,这是一系列bernoulli试验。我有38名人受试者被分为两类执行:P和基于M.在我的分析,每个扬声器具有成功的在P类的概率和成功的在M类的概率θ p × θ 米。我也假设存在的P和M一些社区层面超参数:μ p和μ 米。θpθp\theta_pθp× θ米θp×θm\theta_p\times\theta_mμpμp\mu_pμmμm\mu_m 因此,对于每个扬声器: 和θ 米〜b Ë 吨一个(μ 米 × κ 米,(1 - μ 米)× κ 米)其中κ p和κ 米θp∼beta(μp×κp,(1−μp)×κp)θp∼beta(μp×κp,(1−μp)×κp)\theta_p \sim beta(\mu_p\times\kappa_p, (1-\mu_p)\times\kappa_p)θm∼beta(μm×κm,(1−μm)×κm)θm∼beta(μm×κm,(1−μm)×κm)\theta_m \sim beta(\mu_m\times\kappa_m, (1-\mu_m)\times\kappa_m)κpκp\kappa_pκmκm\kappa_m控制如何达到峰值的分布是围绕和μ 米。μpμp\mu_pμmμm\mu_m 也,μ 米〜b Ë 吨一(甲米,乙米)。μp∼beta(Ap,Bp)μp∼beta(Ap,Bp)\mu_p \sim beta(A_p, B_p)μm∼beta(Am,Bm)μm∼beta(Am,Bm)\mu_m \sim beta(A_m, B_m) 这是我的锯齿模型: model{ ## y = N bernoulli trials ## …

1
PCA和组件分数基于连续变量和二进制变量的混合
我想在由混合类型变量(连续和二进制)组成的数据集上应用PCA。为了说明该过程,我在下面的R中粘贴了一个最小的可复制示例。 # Generate synthetic dataset set.seed(12345) n <- 100 x1 <- rnorm(n) x2 <- runif(n, -2, 2) x3 <- x1 + x2 + rnorm(n) x4 <- rbinom(n, 1, 0.5) x5 <- rbinom(n, 1, 0.6) data <- data.frame(x1, x2, x3, x4, x5) # Correlation matrix with appropriate coefficients # Pearson product-moment: …
13 r  pca 

1
解释R中的逻辑回归输出
我正在使用进行R中的多元逻辑回归glm。预测变量是连续的和分类的。该模型摘要的摘录显示以下内容: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 2.451e+00 2.439e+00 1.005 0.3150 Age 5.747e-02 3.466e-02 1.658 0.0973 . BMI -7.750e-02 7.090e-02 -1.093 0.2743 ... --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 置信区间: 2.5 % 97.5 % (Intercept) 0.10969506 1.863217e+03 Age 0.99565783 …

2
R vs.Excel中的自相关公式
我试图弄清楚R如何计算滞后k自相关(显然,它与Minitab和SAS使用的公式相同),以便可以将其与使用适用于该系列及其k滞后版本的Excel CORREL函数进行比较。R和Excel(使用CORREL)给出的自相关值略有不同。 我也想知道一种计算是否比另一种更正确。
13 r  sas  autocorrelation  excel 


7
黄金标准的含义是什么?
在阅读几篇论文时,我遇到了“黄金套装”或“黄金标准”一词。我不明白是什么使数据集成为黄金标准?同行的接受程度,引用次数以及研究人员的自由和与他所攻击问题的相关性?

1
解释R's plot.stl中的范围条吗?
我很难弄清楚范围条的plot.stl确切含义。我在该问题上找到了加文(Gavin)的帖子,并阅读了文档,我知道它们告诉了被分解组件的相对大小,但是我仍然不确定它们是如何工作的。 例如: 数据:微小条,无刻度季节性:完整条,刻度在-0.6到0.2范围内趋势:另一个微小条(似乎等于数据),无剩余刻度:中号条,从-1.5到0.5 我不明白联系的基础是什么,为什么趋势没有规模。我尝试过stl,decompose乘法和加法的结果相同。
13 r  time-series 

1
您如何选择时间序列中的分析单位(聚合级别)?
如果您可以在任何时间精度水平上测量观测值的时间序列,并且您的研究目标是确定X和Y之间的关系,那么是否有任何经验依据来选择特定级别的聚合而不是另一种聚合?该选择是否仅基于理论和/或实际限制? 对于这个主要问题,我有三个子问题: X或Y在较大级别内的任何非随机变化是否足以选择较小级别的聚合(其中非随机是观测的任何时间模式)? X和Y之间的关系在较小聚合级别上的任何变化是否足以证明较小分析单位的合理性?如果某种变化是可以接受的,那么如何决定多少变化太大呢? 人们是否可以引用出于经验原因或理论原因而认为一种分析单位比另一分析单位引人注目的/定义明确的论点? 我很清楚空间分析中的可修改面积单位问题(Openshaw 1984)。我并没有声称自己是该材料的专家,但是到目前为止,我只想认为较小的分析单位总是更好,因为人们不太可能犯生态谬论(Robinson 1950)。如果您有一个有关汇总地理单位的直接相关参考或答案,我也将不胜感激。

2
可视化是否足以转换数据?
问题 我想绘制由30个参数中的每个参数解释的方差,例如绘制为每个参数的条形不同的条形图,以及y轴上的方差: 但是,方差强烈偏向较小的值,包括0,如以下直方图中所示: 如果我通过,则比较容易看出较小值之间的差异(下面的直方图和柱状图):log(x+1)log⁡(x+1)\log(x+1) 题 在对数刻度上绘制是很常见的,但是绘制同样合理吗?log(x+1)log⁡(x+1)\log(x+1)

2
具有时间不确定性的时间序列中事件的评估者间可靠性
我有多个独立的编码人员,他们试图确定时间序列中的事件-在这种情况下,观看面对面对话的视频并查找特定的非语言行为(例如,头点头),并对每个事件的时间和类别进行编码事件。可以将这些数据合理地视为具有高采样率(30帧/秒)的离散时间序列或连续时间序列,以较易处理的形式为准。 我想计算的互信度的一些措施,但我认为会有一些不确定性,当事件发生; 也就是说,例如,我希望一个编码器可以编码某个特定运动开始的时间比其他编码器认为的开始晚四分之一秒。这些是罕见的事件,如果有帮助的话;事件之间通常至少需要几秒钟(数百个视频帧)。 有没有一种评估评估者之间可靠性的好方法,可以同时考虑到这两种同意和不同意见:(1)评估者是否同意发生什么事件(如果有),以及(2)他们同意什么时候发生?第二点对我很重要,因为我有兴趣了解这些事件相对于对话中发生的其他事件的时机,例如人们所说的话。 我领域的标准做法似乎是将事情分成多个时间片,例如1/4秒左右,汇总每个编码器每个时间片报告的事件,然后计算科恩的kappa或类似的度量。但是切片持续时间的选择是临时的,我对事件时间的不确定性也不太了解。 到目前为止,我最好的想法是我可以计算某种可靠性曲线。像kappa一样,它是窗口大小的函数,在该窗口中,我认为两个事件在同一时间被编码。不过,我不太确定从那里去哪里。

3
在逻辑回归(或其他形式的回归)中测试非线性
Logistic回归的一种假设是logit中的线性。因此,一旦我建立了模型并开始运行,就可以使用Box-Tidwell测试来测试非线性。我的一个连续预测变量(X)对非线性进行了正面测试。我接下来该怎么办? 因为这违反了假设,所以我应该摆脱预测变量(X)或包括非线性变换(X * X)。还是将变量转换为分类变量?如果您有参考,也可以给我指出吗?




By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.