统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何模拟审查数据
我想知道如何模拟n个Weibull分布寿命的样本,其中包括类型I右删失的观测值。例如,让n = 3,形状= 3,比例= 1,审查率= .15,审查时间= .88。我知道如何生成Weibull样本,但是我不知道如何生成在R中类型为I右删失的删失数据。 T = rweibull(3, shape=.5, scale=1)

1
Scikit二项式偏差损失函数
这是scikit GradientBoosting的二项式偏差损失函数, def __call__(self, y, pred, sample_weight=None): """Compute the deviance (= 2 * negative log-likelihood). """ # logaddexp(0, v) == log(1.0 + exp(v)) pred = pred.ravel() if sample_weight is None: return -2.0 * np.mean((y * pred) - np.logaddexp(0.0, pred)) else: return (-2.0 / sample_weight.sum() * np.sum(sample_weight * ((y * pred) …

3
神经网络可以学习功能及其功能派生吗?
我了解到,在某些假设下(在网络和要近似的函数上),神经网络(NN)可以视为函数及其派生类的通用逼近器。实际上,我已经对简单但非平凡的函数(例如多项式)进行了许多测试,似乎我确实可以很好地近似它们和它们的一阶导数(下面显示一个示例)。 然而,我不清楚的是,导致上述结论的定理是否扩展到(或可能扩展到)泛函及其函数导数。例如,考虑以下函数: ,其中函数导数: 其中,完全而不是完全取决于。NN可以学习上面的映射及其功能派生吗?更具体地说,如果一个离散化的域比和提供(在离散点)作为输入和F[ f((x )] = ∫b一个dX ˚F (x )克(x )F[F(X)]=∫一个bdX F(X)G(X)\begin{equation} F[f(x)] = \int_a^b dx ~ f(x) g(x) \end{equation}δF[ f(x )]δF(x )=g(x )δF[F(X)]δF(X)=G(X)\begin{equation} \frac{\delta F[f(x)]}{\delta f(x)} = g(x) \end{equation}F(x )F(X)f(x)G(x )G(X)g(x)XXx[ a ,b ][一个,b][a,b]F(x )F(X)f(x)F[ f(x )]F[F(X)]F[f(x)]作为输出,NN能否正确(至少在理论上)正确学习此映射?如果是这样,它还能学习映射的功能导数吗? 我已经做过许多测试,似乎NN确实可以在某种程度上学习映射。但是,虽然此映射的准确性尚可,但并不理想。麻烦的是计算出的函数导数是完全垃圾(尽管这两个都可能与训练等有关)。一个例子如下所示。F[ f(x )]F[F(X)]F[f(x)] 如果NN不适合学习某个函数及其函数导数,那么还有另一种机器学习方法吗? 例子: (1)以下是近似函数及其衍生物的一个例子:一个NN被训练学习函数在范围[-3,2]: 从该合理得到与近似值: 请注意,正如预期的那样,对的NN近似值及其一阶导数随训练点数,NN体系结构的改善而提高,因为在训练过程中发现了更好的最小值等。F(x )= x3+ x …

1
如何解释缺口箱图
在进行一些EDA时,我决定使用箱形图来说明一个因子的两个水平之间的差异。 该方法ggplot呈现箱形图是令人满意的,但是稍微简单化(下图1图)。在研究箱形图的特性时,我开始尝试刻槽。 我知道,缺口在中位数附近显示CI,并且如果两个框的缺口不重叠,则有“有力的证据”(置信水平为95%)表明中位数有所不同。 在我的情况下(第二幅图),槽口没有有意义的重叠。但是,为什么盒子右侧的底部采用这种奇怪的形式呢? 在小提琴图中绘制相同的数据并不会表明相应小提琴的概率密度有任何异常。


3
马尔可夫链vs.HMM
马尔可夫链对我来说很有意义,我可以用它们来模拟现实生活中问题的概率状态变化。然后是HMM。据说HMM比MC更适合于建模许多问题。但是,人们提到的问题在理解方面有些复杂,例如语音处理。所以我的问题是,您能描述一个HMM比MC更适合的“真实而简单”的问题吗?并解释原因?谢谢

2
为什么STL函数使用随机数据会产生明显的季节性变化
我使用stl(黄土时间序列的季节性分解)函数使用以下代码进行绘制: plot(stl(ts(rnorm(144), frequency=12), s.window="periodic")) 它显示了明显的季节性变化,上面的代码中放有随机数据(rnorm函数)。每次运行都会看到明显的变化,尽管模式是不同的。下面显示了两个这样的模式: 当显示季节性变化时,如何依靠stl函数处理某些数据。是否需要考虑其他一些参数来查看这种季节性变化?感谢您的见解。 代码摘自此页:这是测试自杀计数数据中季节性影响的适当方法吗?


4
将数据分为N个相等的组
我有一个数据框,其中包含4列中的值: 例如:ID,price,click count,rating 我想做的是将此数据帧“拆分”为N个不同的组,其中每个组将具有相同数量的行,且行,点击数和评级属性的分布相同。 任何建议都将受到高度赞赏,因为我对如何解决这个问题丝毫不了解!
11 r  distributions 

1
如何以封闭形式计算?
如何评估封闭形式的正常CDF平方的期望? E[Φ(aZ+b)2]=∫∞−∞Φ(az+b)2ϕ(z)dzE[Φ(aZ+b)2]=∫−∞∞Φ(az+b)2ϕ(z)dz\mathbb{E}\left[\Phi\left(aZ+b\right)^{2}\right] = \int_{-\infty}^{\infty}\Phi\left(az+b\right)^{2}\phi(z)\,dz 这里,,是实数,,和是标准正态随机变量的密度和分布函数,分别。aaabbbZ∼N(0,1)Z∼N(0,1)Z\sim\mathcal{N}(0,1)ϕ(⋅)ϕ(⋅)\phi(\cdot)Φ(⋅)Φ(⋅)\Phi(\cdot)

2
关于连续词袋的问题
我在理解这句话时遇到了麻烦: 首先提出的体系结构类似于前馈NNLM,其中去除了非线性隐藏层,并为所有单词共享了投影层(而不仅仅是投影矩阵)。因此,所有单词都投影到同一位置(对它们的向量进行平均)。 什么是投影层与投影矩阵?说所有单词都投射到相同位置意味着什么?为什么这意味着它们的向量是平均的? 该句子是向量空间中单词表示的有效估计的第3.1节的第一部分(Mikolov等,2013)。

3
精度可调的分类器与召回率
我正在研究二进制分类问题,在这个问题上更重要的是不要出现误报。相当多的假阴性是可以的。例如,我在sklearn中使用了一堆分类器,但我认为它们都不具有显式调整精确度调用权衡的能力(它们确实产生了很好的结果,但无法调整)。 哪些分类器的精度/召回率可调?有什么方法可以影响标准分类器(例如,Random Forest或AdaBoost)的精度/召回权衡吗?

2
为什么我们要从时间序列中删除季节性因素?
在处理时间序列时,有时我们会使用频谱分析来检测并消除季节性。我是时间序列的真正初学者,但我很困惑为什么要从原始时间序列中去除季节性?删除季节性因素是否会使原始数据失真? 通过消除季节性来构建时间序列,我们可以获得什么好处?


2
为什么选择Adaboost和决策树?
我已经阅读了一些有关分类任务的增强算法,尤其是Adaboost。我了解Adaboost的目的是招募几个“弱学习者”,并通过对训练数据进行一系列迭代,推动分类器学习预测模型反复犯错的类。但是,我想知道为什么我所做的许多阅读都使用决策树作为弱分类器。是否有特定原因?是否有某些分类对于Adaboost而言特别好坏?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.