如何复制 Pandas 中的行？

Question

我的 pandas 数据框如下所示：

   Person  ID   ZipCode   Gender
0  12345   882  38182     Female
1  32917   271  88172     Male
2  18273   552  90291     Female

我想将每一行复制 3 次，例如：

   Person  ID   ZipCode   Gender
0  12345   882  38182     Female
0  12345   882  38182     Female
0  12345   882  38182     Female
1  32917   271  88172     Male
1  32917   271  88172     Male
1  32917   271  88172     Male
2  18273   552  90291     Female
2  18273   552  90291     Female
2  18273   552  90291     Female

当然，将索引重置为：

0
1
2
...

我尝试了以下解决方案：

pd.concat([df[:5]]*3, ignore_index=True)

并且：

df.reindex(np.repeat(df.index.values, df['ID']), method='ffill')

但其中 none 有效。

Answer 1

使用`np.repeat`:

版本 1：

尝试使用 np.repeat:

newdf = pd.DataFrame(np.repeat(df.values, 3, axis=0))
newdf.columns = df.columns
print(newdf)

以上代码会输出：

  Person   ID ZipCode  Gender
0  12345  882   38182  Female
1  12345  882   38182  Female
2  12345  882   38182  Female
3  32917  271   88172    Male
4  32917  271   88172    Male
5  32917  271   88172    Male
6  18273  552   90291  Female
7  18273  552   90291  Female
8  18273  552   90291  Female

np.repeat 重复 df、3 次的值。

然后我们通过分配 new_df.columns = df.columns.

添加列

版本 2：

您也可以在第一行指定列名，如下所示：

newdf = pd.DataFrame(np.repeat(df.values, 3, axis=0), columns=df.columns)
print(newdf)

以上代码也会输出：

  Person   ID ZipCode  Gender
0  12345  882   38182  Female
1  12345  882   38182  Female
2  12345  882   38182  Female
3  32917  271   88172    Male
4  32917  271   88172    Male
5  32917  271   88172    Male
6  18273  552   90291  Female
7  18273  552   90291  Female
8  18273  552   90291  Female

Answer 2

你可以这样做。

def do_things(df, n_times):
    ndf = df.append(pd.DataFrame({'name' : np.repeat(df.name.values, n_times) }))
    ndf = ndf.sort_values(by='name')
    ndf = ndf.reset_index(drop=True)
    return ndf

if __name__ == '__main__':
    df = pd.DataFrame({'name' : ['Peter', 'Quill', 'Jackson']}) 
    n_times = 3
    print do_things(df, n_times)

并附上解释...

import pandas as pd
import numpy as np

n_times = 3
df = pd.DataFrame({'name' : ['Peter', 'Quill', 'Jackson']})
#       name
# 0    Peter
# 1    Quill
# 2  Jackson

#   Duplicating data.
df = df.append(pd.DataFrame({'name' : np.repeat(df.name.values, n_times) }))
#       name
# 0    Peter
# 1    Quill
# 2  Jackson
# 0    Peter
# 1    Peter
# 2    Peter
# 3    Quill
# 4    Quill
# 5    Quill
# 6  Jackson
# 7  Jackson
# 8  Jackson

#   The DataFrame is sorted by 'name' column.
df = df.sort_values(by=['name'])
#       name
# 2  Jackson
# 6  Jackson
# 7  Jackson
# 8  Jackson
# 0    Peter
# 0    Peter
# 1    Peter
# 2    Peter
# 1    Quill
# 3    Quill
# 4    Quill
# 5    Quill

#   Reseting the index.
#   You can play with drop=True and drop=False, as parameter of `reset_index()`
df = df.reset_index()
#     index     name
# 0       2  Jackson
# 1       6  Jackson
# 2       7  Jackson
# 3       8  Jackson
# 4       0    Peter
# 5       0    Peter
# 6       1    Peter
# 7       2    Peter
# 8       1    Quill
# 9       3    Quill
# 10      4    Quill
# 11      5    Quill

Answer 3

这些将重复索引并保留操作演示的列

`iloc` 版本 1

df.iloc[np.arange(len(df)).repeat(3)]

`iloc` 版本 2

df.iloc[np.arange(len(df) * 3) // 3]

Answer 4

使用concat:

pd.concat([df]*3).sort_index()
Out[129]: 
   Person   ID  ZipCode  Gender
0   12345  882    38182  Female
0   12345  882    38182  Female
0   12345  882    38182  Female
1   32917  271    88172    Male
1   32917  271    88172    Male
1   32917  271    88172    Male
2   18273  552    90291  Female
2   18273  552    90291  Female
2   18273  552    90291  Female

Answer 5

您可以试试下面的代码：

df = df.iloc[df.index.repeat(3),:].reset_index()

df.index.repeat(3) 将创建一个列表，其中每个索引值将重复 3 次，df.iloc[df.index.repeat(3),:] 将帮助生成一个数据框，其中的行与此列表完全返回。

Answer 6

我不确定为什么从来没有提出过这个建议，但是您可以轻松地将 df.index.repeat 与 .loc 结合使用：

new_df = df.loc[df.index.repeat(3)]

输出：

>>> new_df
   Person   ID  ZipCode  Gender
0   12345  882    38182  Female
0   12345  882    38182  Female
0   12345  882    38182  Female
1   32917  271    88172    Male
1   32917  271    88172    Male
1   32917  271    88172    Male
2   18273  552    90291  Female
2   18273  552    90291  Female
2   18273  552    90291  Female

如何复制 Pandas 中的行？

How can I replicate rows in Pandas?

python

repeat

dataframe

pandas

使用`np.repeat`:

版本 1：

版本 2：

`iloc` 版本 1

`iloc` 版本 2

如何复制 Pandas 中的行？

How can I replicate rows in Pandas?

python

repeat

dataframe

pandas

使用np.repeat:

版本 1：

版本 2：

iloc 版本 1

iloc 版本 2

使用`np.repeat`:

`iloc` 版本 1

`iloc` 版本 2