Questions tagged «python»

Python是一种多范式,动态类型的多用途编程语言。它旨在快速学习,理解和使用并强制使用干净统一的语法。请注意,Python 2自2020年1月1日起已不再受支持。不过,对于特定于版本的Python问题,请添加[python-2.7]或[python-3.x]标签。使用Python变体或库(例如Jython,PyPy,Pandas,Numpy)时,请将其包含在标签中。

6
Matplotlib-如何绘制高分辨率图?
我已经使用matplotlib绘制了一些实验结果(在这里进行了讨论:循环遍历文件并作图。但是,通过单击图像右侧来保存图片会产生非常差的质量/低分辨率图像。 from glob import glob import numpy as np import matplotlib.pyplot as plt import matplotlib as mpl # loop over all files in the current directory ending with .txt for fname in glob("./*.txt"): # read file, skip header (1 line) and unpack into 3 variables WL, ABS, T = np.genfromtxt(fname, …

21
不支持身份验证插件“ caching_sha2_password”
我正在尝试使用python连接器连接到MySQL服务器。我lcherukuri使用身份验证插件创建了一个新用户mysql_native_password。 但是我得到了错误 mysql.connector.errors.NotSupportedError:不支持身份验证插件“ caching_sha2_password” 有人能帮我吗? import mysql.connector cnx = mysql.connector.connect(user='lcherukuri', password='password', host='127.0.0.1', database='test') cnx.close()
81 python  mysql 


5
带有身份验证的python请求(access_token)
我正在尝试将API查询输入python。命令行 curl --header "Authorization:access_token myToken" https://website.com/id 提供一些json输出。myToken是一个十六进制变量,始终保持不变。我想从python进行此调用,以便我可以遍历不同的id并分析输出。有任何想法吗?在需要身份验证之前,我已经使用urllib2进行了此操作。我也看过了requests模块,但是不知道该怎么做。 非常感谢。

2
多重处理导致Python崩溃,并在调用fork()时在另一个线程中发出了错误消息
我是Python的新手,并尝试为我的for循环实现Multiprocessing模块。 我有一个存储在img_urls中的图像网址数组,我需要下载并应用一些Google视觉。 if __name__ == '__main__': img_urls = [ALL_MY_Image_URLS] runAll(img_urls) print("--- %s seconds ---" % (time.time() - start_time)) 这是我的runAll()方法 def runAll(img_urls): num_cores = multiprocessing.cpu_count() print("Image URLS {}",len(img_urls)) if len(img_urls) > 2: numberOfImages = 0 else: numberOfImages = 1 start_timeProcess = time.time() pool = multiprocessing.Pool() pool.map(annotate,img_urls) end_timeProcess = time.time() print('\n Time …

15
ModuleNotFoundError:没有名为“ tools.nnwrap”的模块
我正在尝试导入“火炬”包。同样,我尝试使用如下pip命令安装它,安装甚至开始,但几秒钟后出现错误 下面是我执行的命令 pip install torch 我得到的错误: from tools.nnwrap import generate_wrappers as generate_nn_wrappers ModuleNotFoundError: No module named 'tools.nnwrap' 操作系统: Windows。 IDE:pyCharm 我获得了与此问题相关的唯一链接,但无法解释它。 https://www.gitmemory.com/torch
81 python  pycharm 

17
ImportError:没有名为“ MySQL”的模块
我已经成功下载了MySQL的Connector / Python。我在Python的外壳中使用了以下代码来测试我的连接: import mysql.connector 我收到以下错误消息: Traceback (most recent call last): File "<pyshell#8>", line 1, in <module> import mysql.connector ImportError: No module named 'mysql' 我不明白为什么MySQL不被认可。
81 python  mysql 

3
多处理for循环?
我有一个数组(称为data_inputs),其中包含数百个天文学图像文件的名称。然后处理这些图像。我的代码有效,并且需要几秒钟来处理每个图像。但是,一次只能执行一张图像,因为我是通过for循环运行阵列: for name in data_inputs: sci=fits.open(name+'.fits') #image is manipulated 没有理由我必须先修改映像,因此是否有可能利用计算机上的所有4个内核,每个内核都通过for循环在不同的映像上运行? 我已经阅读了有关该multiprocessing模块的信息,但是不确定如何在我的情况下实现它。我渴望开始multiprocessing工作,因为最终我将不得不在10,000幅以上的图像上运行它。

7
如何选择数据框的最后一列
我已经做了一些寻找该问题答案的搜索,但是我能弄清楚的是: df[df.columns[len(df.columns)-1]] 在我看来,这似乎很古怪,又不合Python(并且很慢?)。 在不指定列名的情况下,为pandas数据框中的最后一列选择数据的最简单方法是什么?
81 python  pandas 

3
如何将Parquet文件读入Pandas DataFrame?
如何在不建立集群计算基础架构(例如Hadoop或Spark)的情况下,将大小适中的Parquet数据集读取到内存中的Pandas DataFrame中?我只想在笔记本电脑上使用简单的Python脚本在内存中读取这些数据,但是数量很少。数据不驻留在HDFS上。它位于本地文件系统上,也可能位于S3中。我不想启动并配置其他服务,例如Hadoop,Hive或Spark。 我以为Blaze / Odo可以做到这一点:Odo文档中提到了Parquet,但是这些示例似乎都是通过外部Hive运行时进行的。
81 python  pandas  parquet  blaze 

4
Python-将字节数组转换为JSON格式
我想将bytes数组转换为JSON格式。这是我的来源: my_bytes_value = b'[{\'Date\': \'2016-05-21T21:35:40Z\', \'CreationDate\': \'2012-05-05\', \'LogoType\': \'png\', \'Ref\': 164611595, \'Classe\': [\'Email addresses\', \'Passwords\'],\'Link\':\'http://some_link.com\'}]' 这是我想要的期望结果: [{ "Date": "2016-05-21T21:35:40Z", "CreationDate": "2012-05-05", "LogoType": "png", "Ref": 164611595, "Classes": [ "Email addresses", "Passwords" ], "Link": "http://some_link.com"}] 首先,我将字节转换为字符串: my_new_string_value = my_bytes_value.decode("utf-8") 但是当我尝试加载到JSON时: my_json = json.loads(my_new_string_value) 我收到此错误: json.decoder.JSONDecodeError: Expecting value: line 1 column 174 (char …
81 python  json 

7
“ double_scalars中遇到无效值”警告,可能为numpy
当我运行代码时,偶尔会以四个为一组的形式收到这些警告。我试图通过在某些语句之前和之后放置调试消息来定位源,以查明源。 Warning: invalid value encountered in double_scalars Warning: invalid value encountered in double_scalars Warning: invalid value encountered in double_scalars Warning: invalid value encountered in double_scalars 这是Numpy警告,什么是双标量? 从Numpy我使用 min(), argmin(), mean() and random.randn() 我也使用Matplotlib

2
何时在Django中使用get,get_queryset,get_context_data?
我最近了解到,当您特别想执行默认视图所不能做的事情时,应该重写get方法: class ExampleView(generic.ListView): template_name = 'ppm/ppm.html' def get(self, request): manager = request.GET.get('manager', None) if manager: profiles_set = EmployeeProfile.objects.filter(manager=manager) else: profiles_set = EmployeeProfile.objects.all() context = { 'profiles_set': profiles_set, 'title': 'Employee Profiles' } 这是很简单的,但是当我应该使用get_queryset或get_context_data过度get?在我看来,他们基本上都在做同样的事情,还是我只是想念一些东西?我可以一起使用吗?这是我感到困惑的主要根源。 因此,我要重申一下:在什么情况下,我会使用overget_queryset或get_context_data反之?
81 python  django 

3
Pandas的性能适用于vs.np.vectorize从现有列创建新列
我正在使用Pandas数据框,并希望根据现有列创建一个新列。对于df.apply()和之间的速度差异,我还没有很好的讨论np.vectorize(),所以我想在这里问一下。 熊猫apply()功能很慢。根据我的测量(在一些实验中显示如下),至少在我的2016 MacBook Pro上,使用np.vectorize()它比使用DataFrame函数快25倍(或更多)apply()。这是预期的结果吗?为什么? 例如,假设我具有带N行的以下数据框: N = 10 A_list = np.random.randint(1, 100, N) B_list = np.random.randint(1, 100, N) df = pd.DataFrame({'A': A_list, 'B': B_list}) df.head() # A B # 0 78 50 # 1 23 91 # 2 55 62 # 3 82 64 # 4 99 80 进一步假设我想根据这两列A和创建一个新列B。在下面的示例中,我将使用一个简单的函数divide()。要应用此功能,我可以使用df.apply()或np.vectorize(): def …

1
在什么情况下可以使用Dask代替Apache Spark?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 4年前关闭。 改善这个问题 我目前正在使用Pandas和Spark进行数据分析。我发现Dask提供了并行化的NumPy数组和Pandas DataFrame。 Pandas使用Python进行数据分析既简单又直观。但是由于系统内存有限,我发现难以处理Pandas中的多个较大数据帧。 简单答案: Apache Spark是一个包罗万象的框架,结合了分布式计算,SQL查询,机器学习以及在JVM上运行的更多功能,并且通常与Hadoop等其他大数据框架共同部署。...一般而言,Dask比Spark更轻巧。 我从http://dask.pydata.org/en/latest/spark.html了解以下详细信息 轻巧轻巧 Dask通常在单台计算机上使用,但在分布式集群上也可以很好地运行。 Dask提供并行数组,数据框,机器学习和自定义算法 Dask对Python用户具有优势,因为它本身就是Python库,因此在出现问题时进行序列化和调试会更加顺利。 Dask放弃了高级理解,以允许用户表达更复杂的并行算法。 Dask的重量更轻,并且更易于集成到现有代码和硬件中。 如果您想要一个可以完成所有任务的项目,并且已经在大数据硬件上,那么Spark是一个安全的选择 Spark通常用于中小型集群,但也可以在一台机器上很好地运行。 我从下面的链接https://www.continuum.io/blog/developer-blog/high-performance-hadoop-anaconda-and-dask-your-cluster了解有关Dask的更多信息 如果在将Pandas,NumPy或其他计算与Python配合使用时在一台计算机上遇到内存问题,存储限制或CPU边界,Dask可以帮助您在单台计算机上扩展所有核心,或进行扩展在整个群集的所有核心和内存上。 Dask在单台机器上运行良好,可以利用笔记本电脑上的所有内核并处理大于内存的数据 在具有数百个节点的群集上灵活地伸缩。 Dask从Python原生处理具有不同格式和存储系统的数据,包括Hadoop分布式文件系统(HDFS)和Amazon S3。Anaconda和Dask可以与您现有的企业Hadoop发行版一起使用,包括Cloudera CDH和Hortonworks HDP。 http://dask.pydata.org/en/latest/dataframe-overview.html 局限性 Dask.DataFrame没有实现整个Pandas接口。用户对此感到失望。值得注意的是,dask.dataframe具有以下限制: 从未排序的列设置新索引非常昂贵 许多操作,例如groupby-apply和未排序列上的join都需要设置索引,如上所述,这很昂贵 熊猫API非常大。Dask.dataframe不会尝试实现许多熊猫功能或任何更奇特的数据结构,例如NDFrames 感谢Dask开发人员。似乎是很有前途的技术。 总的来说,我可以理解Dask比spark更易于使用。达斯(Dask)与熊猫(Pandas)一样灵活,具有更大的计算能力和更多的CPU并行度。 我了解上述有关Dask的所有事实。 因此,使用Dask可以处理大约多少数据(以TB为单位)?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.