统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
汇总和分析数据的最佳方法
最近刚开始自学机器学习和数据分析,我发现自己对创建和查询大量数据的需求感到困惑。我想对自己在职业和个人生活中积累的数据进行分析,但是我不确定执行以下操作的最佳方法: 我应该如何存储这些数据?Excel?SQL??? 初学者开始尝试分析这些数据的好方法是什么?我是一名专业的计算机程序员,所以复杂性不在于编写程序,而是或多或少地针对数据分析领域。 编辑:为我的含糊而道歉,当您第一次开始学习某些东西时,很难知道您不知道的内容,是吗?;) 话虽如此,我的目的是将其应用于两个主要主题: 软件团队指标(考虑敏捷速度,量化风险,在x个故事点数的情况下成功完成迭代的可能性) 机器学习(例如,在给定的一组模块中发生了系统异常),一个模块将在现场抛出异常的可能性是多少,代价是多少,数据可以告诉我哪些关键模块需要改进,从而获得最好的解决方案,预测用户接下来要使用哪个系统部分以开始加载数据,等等)。


1
支持向量机可以用于大数据吗?
以我对SVM的了解有限,它对于简短而又胖的数据矩阵(很多特征,并且没有太多实例)很有用,但不适用于大数据。XXX 我知道一个原因是内核矩阵是矩阵,其中是数据中实例的数量。如果说100K数据,则内核矩阵将具有元素,并可能占用约80G内存。ķķKn × nñ×ñn \times nññnķķK1010101010^{10} 是否可以对大数据使用SVM进行任何修改?(以100K到1M数据点的规模为例吗?)

3
如何以并行/分布式方式运行线性回归以进行大数据设置?
我正在处理一个非常大的线性回归问题,数据量太大,以至于必须将它们存储在一组机器上。将所有样本聚合到一台计算机的内存(甚至磁盘)中将太大了 为了对这些数据进行回归,我正在考虑一种并行方法,即对每个单独的框进行回归,然后根据每个单独的beta的统计数据(可能是平均值或中位数)来计算beta。 这有意义吗 ?如果是的话,我应该如何获得预期的总R2R2R^2的每一个人R2R2R^2?

2
为什么在达到最佳样本量之前停止A / B测试是错误的?
我负责介绍我公司的A / B测试结果(在网站上运行)。我们进行了一个月的测试,然后定期检查p值,直到达到显着性为止(或者,如果长时间运行后未达到显着性,则放弃),我现在发现这是一种错误的做法。 我现在想停止这种做法,但是要这样做,我想了解为什么这是错误的。我知道效果大小,样本大小(N),α显着性标准(α)和统计功效,或选择或隐含的β(β)在数学上都是相关的。但是,在达到所需样本量之前停止测试会发生什么变化呢? 我在这里阅读了几篇文章(即this,this和this),他们告诉我,我的估计会有所偏差,并且我的Type 1错误的发生率急剧增加。但是那是怎么发生的呢?我正在寻找数学解释,这种解释可以清楚地显示出样本量对结果的影响。我想这与我上面提到的因素之间的关系有关,但是我无法找出确切的公式并自行解决。 例如,过早停止测试会增加类型1的错误率。好的。但为什么?如何增加类型1的错误率?我想念这里的直觉。 请帮忙。

2
随机变量和随机样本有什么区别?
当我学习统计学时,这两个表达使我很困惑。在我看来,它们是完全不同的东西。 甲随机样本是从群体中随机取一个样品,而随机变量是这样一组的实验的所有可能结果的映射到实数的函数。 但是,假设我画了一些样本,,和,其中和未知,那么,,随机样本还是随机变量?X1X1X_1X2X2X_2X3X3X_3Xi∼N(μ,σ2)Xi∼N(μ,σ2)X_i \sim N(\mu,\sigma^2)μμ\muσσ\sigmaX1X1X_1X2X2X_2X3X3X_3

1
通常,推理比进行预测难吗?
我的问题来自以下事实。我一直在阅读有关机器学习的文章,博客,讲座和书籍。我的印象是,机器学习从业人员似乎对统计学家/计量经济学所关心的许多事情都漠不关心。尤其是,机器学习从业者强调预测准确性胜于推理。 当我在Coursera上学习 Andrew Ng的机器学习时,便出现了这样一个例子。当他讨论简单线性模型时,他没有提及估计量的BLUE属性,也没有提到异方差如何“使”置信区间无效。相反,他专注于梯度下降实现和交叉验证/ ROC曲线的概念。我的计量经济学/统计学类未涵盖这些主题。 另一个例子发生在我参加Kaggle比赛时。我在读别人的代码和想法。很大一部分参与者只是将所有内容都放入了SVM /随机森林/ XGBoost中。 另一个例子是关于逐步模型选择。至少在在线和Kaggle上,该技术得到了广泛使用。许多经典的机器学习教科书也对此进行了介绍,例如《统计学习入门》。但是,根据这个答案(这很有说服力),逐步模型选择面临很多问题,尤其是当涉及到“发现真实模型”时。似乎只有两种可能性:机器学习从业者不知道逐步解决问题,或者机器学习从业者知道,但是他们不在乎。 所以这是我的问题: (总的来说)机器学习从业者专注于预测,因此不关心统计学家/经济学家关心的很多事情吗? 如果这是真的,那么背后的原因是什么呢?是因为在某种意义上推论更加困难吗? 在线上有大量关于机器学习(或预测)的材料。但是,如果我对学习推理感兴趣,可以从网上查阅哪些资源? 更新:我刚刚意识到“推断”一词可能意味着很多东西。我所说的“推论”是指诸如 做原因或造成?或更笼统地说,之间的因果关系是什么?Y Y X X 1,X 2,⋯ ,X nXXXÿÿYÿÿYXXXX1个,X2,⋯ ,XñX1个,X2,⋯,XñX_1,X_2,\cdots,X_n 既然“所有模型都错了”,那么我们的模型与真实模型有多“错”? 有了样本的信息,我们可以对总体说些什么?我们有多自信? 由于我非常有限的统计知识,我什至不确定这些问题是否属于统计领域。但是这些是机器学习从业者似乎并不关心的问题类型。也许统计学家也不在乎?我不知道。

5
在回归分析中,交叉熵成本是否有意义?
在回归(相对于分类)的上下文中,交叉熵成本是否有意义?如果是这样,您可以通过TensorFlow给出一个玩具示例吗?如果没有,为什么不呢? 我正在阅读迈克尔·尼尔森(Michael Nielsen)的《神经网络和深度学习》中的交叉熵,它似乎可以自然地用于回归和分类,但是我不知道您如何在TensorFlow中有效地应用它。损失函数采用logit(我也不是很了解),它们在此处归类



1
如何修复LogisticRegressionCV中的不收敛
我正在使用scikit-learn对一组数据执行交叉验证并进行交叉验证(约有14个参数,且具有> 7000个标准化观测值)。我也有一个目标分类器,其值为1或0。 我的问题是,无论使用什么求解器,我都会不断收到收敛警告... model1 = linear_model.LogisticRegressionCV(cv=10,verbose=1,n_jobs=-1,scoring='roc_auc',solver='newton-cg',penalty='l2') /home/b/anaconda/lib/python2.7/site-packages/scipy/optimize/linesearch.py:285: LineSearchWarning: The line search algorithm did not converge warn('The line search algorithm did not converge', LineSearchWarning) /home/b/anaconda/lib/python2.7/site-packages/sklearn/utils/optimize.py:193: UserWarning: Line Search failed model2 = linear_model.LogisticRegressionCV(cv=10,verbose=1,n_jobs=-1,scoring='roc_auc',solver='sag',penalty='l2') max_iter reached after 2 seconds max_iter reached after 2 seconds max_iter reached after 2 seconds max_iter reached after 2 …

4
行规范化的目的是什么
我理解列归一化背后的原因,因为即使没有按相同的比例尺对特征进行加权,也可以使特征得到相等的加权-但是,在最近的相邻文献中,列和行均被归一化。什么是行归一化/为什么要对行进行归一化?具体来说,行归一化的结果如何影响行向量之间的相似度/距离?

4
在逻辑回归分析中,对于连续自变量,我应如何检查对数线性的假设?
我对逻辑回归分析中连续预测变量的logit线性假设感到困惑。在使用单变量logistic回归分析筛选潜在预测指标时,我们是否需要检查线性关系? 就我而言,我正在使用多元逻辑回归分析来确定参与者中与营养状况(二分结果)相关的因素。连续变量包括年龄,Charlson合并症评分,Barthel指数评分,握力,GDS评分,BMI等。我的第一步是使用简单的逻辑回归筛选重要变量。在每个连续变量的简单逻辑回归分析过程中,是否需要检查线性假设?还是应该在最终的多元逻辑回归模型中进行检查? 此外,据我了解,我们需要先将非线性连续变量转化为模型,然后再进行转换。我可以对非线性连续变量进行分类而不是进行转换吗?


1
高斯过程回归中的超参数调整
我正在尝试调整已实现的高斯过程回归算法的超参数。我只是想最大化由公式 ,其中K是与元素K_ {ij} = k(x_i,x_j)= b ^ {-1} \ exp(-\ frac {1} {2}(x_i-x_j)^ TM(x_i-x_j))+ a ^ {-1 } \ delta_ {ij}其中M = lI,而a,b和l是超参数。ķķ我Ĵ=ķ(X我,XĴ)=b-1个EXP(-1日志(y | X,θ)= − 12ÿŤķ− 1ÿy − 12日志(det (K))− n2日志(2 π)日志⁡(ÿ|X,θ)=-1个2ÿŤķÿ-1个ÿ-1个2日志⁡(t(ķ))-ñ2日志⁡(2π)\log(\mathbf{y}|X,\mathbf{\theta})=-\frac{1}{2} \mathbf{y}^TK_y^{-1}\mathbf{y}-\frac{1}{2}\log(\det(K))-\frac{n}{2}\log(2\pi)ķķK中号=升我一个,b升ķ我Ĵ= k (x一世,XĴ)= b− 1经验值(− 12(x一世− xĴ)Ť中号(x一世− xĴ))+ 一个− 1δ我Ĵķ一世Ĵ=ķ(X一世,XĴ)=b-1个经验值⁡(-1个2(X一世-XĴ)Ť中号(X一世-XĴ))+一种-1个δ一世ĴK_{ij}=k(x_i,x_j)=b^{-1}\exp(-\frac{1}{2}(x_i-x_j)^TM(x_i-x_j))+a^{-1}\delta_{ij}中号= 升余中号=升一世M=lI一,b一种,ba,b升升l 对数边际似然率wrt参数的偏导数由以下日志(y | X,θ)dθ= 12吨ř 一个Ç ë( …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.