如何将CSV文件数据导入PostgreSQL表?


601

如何编写一个存储过程,该存储过程从CSV文件导入数据并填充表?


18
为什么要使用存储过程?COPY可以解决问题
Frank Heikens 2010年

1
我有一个上载csv文件的用户界面,为此,我需要实际从cvs文件复制数据的存储过程
vardhan 2010年

3
您能详细说明如何使用COPY吗?
vardhan 2010年

17
Bozhidar Batsov已经给您提供了一个示例链接,精美的手册也可能会有所帮助:postgresql.org/docs/8.4/interactive/sql-copy.html
Frank Heikens 2010年

Answers:


774

看一下这篇简短的文章


解决方案的解释如下:

创建表:

CREATE TABLE zip_codes 
(ZIP char(5), LATITUDE double precision, LONGITUDE double precision, 
CITY varchar, STATE char(2), COUNTY varchar, ZIP_CLASS varchar);

将数据从CSV文件复制到表格中:

COPY zip_codes FROM '/path/to/csv/ZIP_CODES.txt' WITH (FORMAT csv);

46
如果您没有超级用户访问权限,则实际使用\ copy会达到相同的效果;当以非root帐户使用COPY时,它会抱怨我的Fedora 16。
asksw0rder 2012年

81
提示:您可以使用zip_codes(col1,col2,col3)指示CSV中包含哪些列。这些列必须按照它们在文件中出现的顺序列出。
David Pelaez

6
@ asksw0rder \ copy是否具有相同的语法?bcoz我收到\ copy语法错误
JhovaniC

6
我应该包括标题行吗?
bernie2436

116
您可以轻松地添加标题行-只需在选项中添加HEADER: COPY zip_codes FROM '/path/to/csv/ZIP_CODES.txt' DELIMITER ',' CSV HEADER; postgresql.org/docs/9.1/static/sql-copy.html
Barrett Clark

219

如果您没有使用权限COPY(在db服务器上工作),则可以\copy改用(在db客户端中工作)。使用与Bozhidar Batsov相同的示例:

创建表:

CREATE TABLE zip_codes 
(ZIP char(5), LATITUDE double precision, LONGITUDE double precision, 
CITY varchar, STATE char(2), COUNTY varchar, ZIP_CLASS varchar);

将数据从CSV文件复制到表格中:

\copy zip_codes FROM '/path/to/csv/ZIP_CODES.txt' DELIMITER ',' CSV

您还可以指定要读取的列:

\copy zip_codes(ZIP,CITY,STATE) FROM '/path/to/csv/ZIP_CODES.txt' DELIMITER ',' CSV

请参阅COPY文档

请勿将COPY与psql指令\ copy混淆。\ copy调用COPY FROM STDIN或COPY TO STDOUT,然后将数据提取/存储在psql客户端可访问的文件中。因此,使用\ copy时,文件的可访问性和访问权限取决于客户端而不是服务器。

并注意:

对于标识列,COPY FROM命令将始终写入输入数据中提供的列值,例如INSERT选项OVERRIDING SYSTEM VALUE。


从'/Users/files/Downloads/WOOD.TXT'DELIMITER',CSV HEADER复制投票者(ZIP,CITY); 错误:最后一个预期的列之后的额外数据上下文:COPY选民,第2行:“ OH0012781511,87,26953,HOUSEHOLDER,SHERRY,LEIGH ,, 11/26 / 1965,08 / 19/1988,,211 N GARFIELD ST,,BLOOMD ...”
JZ。

@JZ。我有一个类似的错误。这是因为我有多余的空白列。检查您的csv,如果您有空白列,则可能是原因。
亚历克斯·贝内特

5
这是有点误导:之间的差别COPY,并\copy不仅仅是权限得多,而且你不能简单地添加了``使它神奇的工作。请参阅此处的描述(在导出的上下文中):stackoverflow.com/a/1517692/157957
IMSoP

@IMSoP:是的,我添加了服务器和客户端的说明以进行澄清
bjelli

@bjelli是\ copy比复制慢吗?我在RDS上有一个1.5MB的文件和一个db.m4.large实例,并且该复制命令已经运行了几个小时(至少3个)。
塞巴斯蒂安

79

一种快速的实现方法是使用Python pandas库(版本0.15或更高版本效果最好)。这将为您创建列-尽管显然对数据类型所做的选择可能不是您想要的。如果不能完全满足您的要求,则可以始终使用作为模板生成的“创建表”代码。

这是一个简单的例子:

import pandas as pd
df = pd.read_csv('mypath.csv')
df.columns = [c.lower() for c in df.columns] #postgres doesn't like capitals or spaces

from sqlalchemy import create_engine
engine = create_engine('postgresql://username:password@localhost:5432/dbname')

df.to_sql("my_table_name", engine)

这是一些代码,向您展示如何设置各种选项:

# Set it so the raw sql output is logged
import logging
logging.basicConfig()
logging.getLogger('sqlalchemy.engine').setLevel(logging.INFO)

df.to_sql("my_table_name2", 
          engine, 
          if_exists="append",  #options are ‘fail’, ‘replace’, ‘append’, default ‘fail’
          index=False, #Do not output the index of the dataframe
          dtype={'col1': sqlalchemy.types.NUMERIC,
                 'col2': sqlalchemy.types.String}) #Datatypes should be [sqlalchemy types][1]

6
此外,if_exists可以将参数设置为替换或附加到现有表,例如df.to_sql("fhrs", engine, if_exists='replace')
joelostblom 2015年

1
用户名和密码:需要创建登录名并为用户分配数据库。如果使用pgAdmin,则使用GUI创建“登录/组角色”
Somnath Kadam

9
Pandas是一种加载到sql(相对于csv文件)的超级慢的方式。可以慢几个数量级。
user48956 '17

这可能是一种写入数据的方法,但是即使具有批处理和良好的计算能力,它也非常慢。使用CSV是完成此操作的好方法。
安基·辛格

df.to_sql() 真的很慢,您可以使用 d6tstack.utils.pd_to_psql()d6tstack性能比较
citynorman

30

您也可以使用pgAdmin,它提供了一个GUI来进行导入。这在此SO线程中显示。使用pgAdmin的优点是它也适用于远程数据库。

但是,与之前的解决方案非常相似,您将需要在数据库中拥有表。每个人都有自己的解决方案,但我通常要做的是在Excel中打开CSV,复制标题,将带有换位符的特殊内容粘贴在不同的工作表上,将相应的数据类型放在下一列中,然后将其复制并粘贴到文本编辑器中加上适当的SQL表创建查询,如下所示:

CREATE TABLE my_table (
    /*paste data from Excel here for example ... */
    col_1 bigint,
    col_2 bigint,
    /* ... */
    col_n bigint 
)

1
请显示您粘贴的数据的几个示例行
dcorking '18

29

这里的大多数其他解决方案要求您事先/手动创建表。在某些情况下(例如,如果目标表中有很多列),这可能不切实际。因此,以下方法可能会派上用场。

提供csv文件的路径和列数,您可以使用以下函数将表加载到临时表中,该表将命名为 target_table

假定第一行具有列名。

create or replace function data.load_csv_file
(
    target_table text,
    csv_path text,
    col_count integer
)

returns void as $$

declare

iter integer; -- dummy integer to iterate columns with
col text; -- variable to keep the column name at each iteration
col_first text; -- first column name, e.g., top left corner on a csv file or spreadsheet

begin
    create table temp_table ();

    -- add just enough number of columns
    for iter in 1..col_count
    loop
        execute format('alter table temp_table add column col_%s text;', iter);
    end loop;

    -- copy the data from csv file
    execute format('copy temp_table from %L with delimiter '','' quote ''"'' csv ', csv_path);

    iter := 1;
    col_first := (select col_1 from temp_table limit 1);

    -- update the column names based on the first row which has the column names
    for col in execute format('select unnest(string_to_array(trim(temp_table::text, ''()''), '','')) from temp_table where col_1 = %L', col_first)
    loop
        execute format('alter table temp_table rename column col_%s to %s', iter, col);
        iter := iter + 1;
    end loop;

    -- delete the columns row
    execute format('delete from temp_table where %s = %L', col_first, col_first);

    -- change the temp table name to the name given as parameter, if not blank
    if length(target_table) > 0 then
        execute format('alter table temp_table rename to %I', target_table);
    end if;

end;

$$ language plpgsql;

1
嗨,穆罕默德,谢谢您发布的答案,但是当我运行您的代码时,我收到以下错误消息:错误:架构“数据”不存在
user2867432 '16

user2867432,您需要更改相应使用的架构名称(例如public
mehmet

嗨,Mehmet,谢谢您的解决方案,它是完美的,但是仅当postgres DB用户是超级用户时才有效,有没有办法使它在没有超级用户的情况下工作?
Geeme

Geeme:在这里阅读“安全定义器” ,但我自己并未使用它。
mehmet

漂亮的答案!尽管在我的代码中对于他人的可读性,我不会太通用。
Manohar Reddy Poreddy

19

如Paul所述,导入在pgAdmin中有效:

右键单击表->导入

选择本地文件,格式和编码

这是德语pgAdmin GUI屏幕截图:

pgAdmin导入GUI

您可以使用DbVisualizer做类似的事情(我有许可证,不确定免费版本)

右键单击表格->导入表格数据...

DbVisualizer导入GUI


2
DBVisualizer花了50秒的时间来导入具有三个字段的1400行-我不得不将所有内容从String投射回原本应该的样子。
Noumenon

19
COPY table_name FROM 'path/to/data.csv' DELIMITER ',' CSV HEADER;

10
  1. 首先创建一个表

  2. 然后使用copy命令复制表详细信息:


“到csv文件的路径”,“定界符”,“ csv标头”中复制 table_name(C1,C2,C3 ....);

谢谢


3
这怎么不是被接受的答案?当数据库已经有执行此命令的命令时,为什么还要编写python脚本?
Wes


8

使用PostgreSQL的个人经验,仍在等待更快的方法。

1.如果文件存储在本地,则首先创建表框架:

    drop table if exists ur_table;
    CREATE TABLE ur_table
    (
        id serial NOT NULL,
        log_id numeric, 
        proc_code numeric,
        date timestamp,
        qty int,
        name varchar,
        price money
    );
    COPY 
        ur_table(id, log_id, proc_code, date, qty, name, price)
    FROM '\path\xxx.csv' DELIMITER ',' CSV HEADER;

2.当\ path \ xxx.csv在服务器上时,postgreSQL没有访问服务器的权限,您将必须通过内置的pgAdmin功能导入.csv文件。

右键单击表名称,选择导入。

在此处输入图片说明

如果仍有问题,请参考本教程。 http://www.postgresqltutorial.com/import-csv-file-into-posgresql-table/


6

如何将CSV文件数据导入PostgreSQL表?

脚步:

  1. 需要在终端中连接PostgreSQL数据库

    psql -U postgres -h localhost
  2. 需要创建数据库

    create database mydb;
  3. 需要创建用户

    create user siva with password 'mypass';
  4. 与数据库连接

    \c mydb;
  5. 需要创建架构

    create schema trip;
  6. 需要创建表

    create table trip.test(VendorID int,passenger_count int,trip_distance decimal,RatecodeID int,store_and_fwd_flag varchar,PULocationID int,DOLocationID int,payment_type decimal,fare_amount decimal,extra decimal,mta_tax decimal,tip_amount decimal,tolls_amount int,improvement_surcharge decimal,total_amount
    );
  7. 将CSV文件数据导入到PostgreSQL

    COPY trip.test(VendorID int,passenger_count int,trip_distance decimal,RatecodeID int,store_and_fwd_flag varchar,PULocationID int,DOLocationID int,payment_type decimal,fare_amount decimal,extra decimal,mta_tax decimal,tip_amount decimal,tolls_amount int,improvement_surcharge decimal,total_amount) FROM '/home/Documents/trip.csv' DELIMITER ',' CSV HEADER;
  8. 查找给定的表数据

    select * from trip.test;

5

恕我直言,最方便的方法是使用csvkit中csvsql遵循“将CSV数据导入到postgresql中,这是一种舒适的方法;-) ” ,这是一个可通过pip安装的python软件包。


3
链接腐烂了!您链接到的文章不再有效,这使我不舒服:(
chbrown

您可能要提及他是py。
mountainclimber

1
对我来说,如果尝试导入大的CSV文件,我会收到一个MemoryError消息,因此看起来好像没有流。
DavidC

@DavidC有趣。您的文件有多大?你有多少内存?如果它没有像看起来那样流式传输,我建议在插入之前对数据进行分块处理
sal的

1
该文件大小为5GB,我有2GB内存。我放弃了,最后使用脚本来生成CREATE TABLE和COPY命令。
DavidC

3

在Python中,您可以使用以下代码通过列名称自动创建PostgreSQL表:

import pandas, csv

from io import StringIO
from sqlalchemy import create_engine

def psql_insert_copy(table, conn, keys, data_iter):
    dbapi_conn = conn.connection
    with dbapi_conn.cursor() as cur:
        s_buf = StringIO()
        writer = csv.writer(s_buf)
        writer.writerows(data_iter)
        s_buf.seek(0)
        columns = ', '.join('"{}"'.format(k) for k in keys)
        if table.schema:
            table_name = '{}.{}'.format(table.schema, table.name)
        else:
            table_name = table.name
        sql = 'COPY {} ({}) FROM STDIN WITH CSV'.format(table_name, columns)
        cur.copy_expert(sql=sql, file=s_buf)

engine = create_engine('postgresql://user:password@localhost:5432/my_db')

df = pandas.read_csv("my.csv")
df.to_sql('my_table', engine, schema='my_schema', method=psql_insert_copy)

这也相对较快,我可以在大约4分钟的时间内导入超过330万行。



1

如果您需要从文本/解析多行CSV导入的简单机制,则可以使用:

CREATE TABLE t   -- OR INSERT INTO tab(col_names)
AS
SELECT
   t.f[1] AS col1
  ,t.f[2]::int AS col2
  ,t.f[3]::date AS col3
  ,t.f[4] AS col4
FROM (
  SELECT regexp_split_to_array(l, ',') AS f
  FROM regexp_split_to_table(
$$a,1,2016-01-01,bbb
c,2,2018-01-01,ddd
e,3,2019-01-01,eee$$, '\n') AS l) t;

DBFiddle演示


1

DBeaver Community Edition(dbeaver.io)使得连接数据库变得很简单,然后导入CSV文件以上传到PostgreSQL数据库。它还使发布查询,检索数据以及将结果集下载为CSV,JSON,SQL或其他常见数据格式变得容易。

它是面向SQL程序员,DBA和分析人员的FOSS多平台数据库工具,支持所有流行的数据库:MySQL,PostgreSQL,SQLite,Oracle,DB2,SQL Server,Sybase,MS Access,Teradata,Firebird,Hive,Presto等。它是TOAD for Postgres,TOAD for SQL Server或Toad for Oracle的可行的FOSS竞争对手。

我与DBeaver没有任何隶属关系。我喜欢这个价格(免费!)和功能齐全,但是我希望他们能更多地打开这个DBeaver / Eclipse应用程序,并轻松地向DBeaver / Eclipse中添加分析小部件,而不是要求用户仅支付199美元的年度订阅费用直接在应用程序内创建图形和图表。我的Java编码技能很生疏,我不想花数周的时间重新学习如何构建Eclipse窗口小部件,(只是发现DBeaver可能已禁用向DBeaver Community Edition添加第三方窗口小部件的功能。)

作为Java开发人员的DBeaver高级用户能否提供一些有关创建分析小部件以添加到DBeaver社区版的步骤的见解?


很高兴了解如何实际使用DBeaver导入CSV文件。无论如何,这可能会有所帮助:dbeaver.com/docs/wiki/Data-transfer
umbe1987

0

创建表,并具有用于在csv文件中创建表的必填列。

  1. 打开postgres并右键单击要加载的目标表,然后选择导入并更新“ 文件选项”部分中的以下步骤

  2. 现在浏览文件名中的文件

  3. 选择格式的csv

  4. 编码为ISO_8859_5

现在转到杂项。选项并检查标题,然后单击导入。


0

我创建了一个小工具,csv可以很容易地将文件导入PostgreSQL,只需一个命令,它将创建并填充表,不幸的是,目前自动创建的所有字段都使用TEXT类型。

csv2pg users.csv -d ";" -H 192.168.99.100 -U postgres -B mydatabase

该工具可以在https://github.com/eduardonunesp/csv2pg上找到


您制作了一个等效于的单独工具psql -h 192.168.99.100 -U postgres mydatabase -c "COPY users FROM 'users.csv' DELIMITER ';' CSV"?我猜它创建表的那部分很好,但是由于每个字段都是文本,所以它不是超级有用
GammaGames

1
行动,谢谢大家的注意。是的,我做到了,只花了几个小时,就在Go和pq中学习了很不错的东西,在Go中学习了pq和数据库API。
Eduardo Pereira
By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.