佳木斯湛栽影视文化发展公司

主頁(yè) > 知識(shí)庫(kù) > pandas 實(shí)現(xiàn)某一列分組,其他列合并成list

pandas 實(shí)現(xiàn)某一列分組,其他列合并成list

熱門(mén)標(biāo)簽:客戶(hù)服務(wù) 電話運(yùn)營(yíng)中心 Win7旗艦版 語(yǔ)音系統(tǒng) 呼叫中心市場(chǎng)需求 硅谷的囚徒呼叫中心 百度AI接口 企業(yè)做大做強(qiáng)

pandas列轉(zhuǎn)換為字典,但將相同第一列(鍵)的所有值合并為一個(gè)鍵

形式一:

import pandas as pd 
# data
data = pd.DataFrame({'column1':['key1','key1','key2','key2'],
    'column2':['value1','value2','value3','value3']})
print(data) 
# Grouped dict
data_dict = data.groupby('column1').column2.apply(list).to_dict() 
print(data_dict)

輸出結(jié)果:

 column1 column2
0  key1 value1
1  key1 value2
2  key2 value3
3  key2 value3 
{'key1': ['value1', 'value2'], 'key2': ['value3', 'value3']}

形式二:

import pandas as pd
# data
df = pd.DataFrame({'column1':['key1','key1','key2','key2'],
    'column2':['value1','value2','value1','value2'],
    'column3':['value11','value11','value22','value22'],
    'column4':['value44','value44','value55','value55']}) 
# Grouped dict
data_dict = df.groupby('column1').apply(lambda x: {col:x[col].tolist() for col in x.columns if col != 'column2'}).to_dict()
print(data_dict) 
data_dict2 = df.groupby('column1').apply(lambda x: {col:x[col].tolist()[0] if col != 'column2' else x[col].tolist() for col in x.columns}).to_dict()
print(data_dict2)

輸出結(jié)果:

#data_dict
{
  'key1': {
    'column1': ['key1', 'key1'], 
    'column3': ['value11', 'value11'], 
    'column4': ['value44', 'value44']
  }, 
  'key2': {
    'column1': ['key2', 'key2'], 
    'column3': ['value22', 'value22'], 
    'column4': ['value55', 'value55']
  }
}
#data_dict2
{
  'key1': {
    'column1': 'key1', 
    'column2': ['value1', 'value2'], 
    'column3': 'value11', 
    'column4': 'value44'
  }, 
  'key2': {
    'column1': 'key2', 
    'column2': ['value1', 'value2'], 
    'column3': 'value22', 
    'column4': 'value55'
  }
}

補(bǔ)充:pandas中,利用groupby分組后,對(duì)字符串字段進(jìn)行合并拼接

在pandas里對(duì)于數(shù)值字段而言,groupby后可以用sum()、max()等方法進(jìn)行簡(jiǎn)單的處理,對(duì)于字符串字段, 如果把它們的值拼接在一起,可以用使用 str.cat() 和 lamda 方法。

如,將下面表格中的內(nèi)容,對(duì)skill字段按照id進(jìn)行分組合并

實(shí)現(xiàn)代碼:

import pandas as pd
file_name='test.xlsx'
df=pd.read_excel(file_name)
data=df.groupby('id')['skill'].apply(lambda x:x.str.cat(sep=':')).reset_index()
print(data)

效果如下:

另,數(shù)據(jù)處理時(shí),常常需要將某一列進(jìn)行拆分,分列,替換等,相關(guān)的函數(shù)有str.split()、str.extract()、str.replace().

以上為個(gè)人經(jīng)驗(yàn),希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。如有錯(cuò)誤或未考慮完全的地方,望不吝賜教。

您可能感興趣的文章:
  • Pandas中DataFrame的分組/分割/合并的實(shí)現(xiàn)
  • pandas 實(shí)現(xiàn)分組后取第N行
  • pandas分組排序 如何獲取第二大的數(shù)據(jù)
  • pandas group分組與agg聚合的實(shí)例
  • pandas groupby分組對(duì)象的組內(nèi)排序解決方案
  • pandas組內(nèi)排序,并在每個(gè)分組內(nèi)按序打上序號(hào)的操作

標(biāo)簽:山西 喀什 長(zhǎng)沙 崇左 海南 山西 濟(jì)南 安康

巨人網(wǎng)絡(luò)通訊聲明:本文標(biāo)題《pandas 實(shí)現(xiàn)某一列分組,其他列合并成list》,本文關(guān)鍵詞  ;如發(fā)現(xiàn)本文內(nèi)容存在版權(quán)問(wèn)題,煩請(qǐng)?zhí)峁┫嚓P(guān)信息告之我們,我們將及時(shí)溝通與處理。本站內(nèi)容系統(tǒng)采集于網(wǎng)絡(luò),涉及言論、版權(quán)與本站無(wú)關(guān)。
  • 相關(guān)文章
  • 收縮
    • 微信客服
    • 微信二維碼
    • 電話咨詢(xún)

    • 400-1100-266
    齐河县| 合水县| 沧州市| 凌海市| 萍乡市| 金坛市| 西丰县| 通江县| 长垣县| 天水市| 洮南市| 垦利县| 石景山区| 正安县| 五峰| 莲花县| 张北县| 陈巴尔虎旗| 翁源县| 汝阳县| 南江县| 夏津县| 丹阳市| 略阳县| 岫岩| 和硕县| 若尔盖县| 成武县| 长兴县| 阜新| 湖南省| 淮南市| 新津县| 宜兰县| 延安市| 苍梧县| 正安县| 专栏| 原阳县| 金乡县| 兴义市|