パンダは結果を列にグループ化

8

私はこのようなデータフレームを持っています：

x = pd.DataFrame({
    'audio': ['audio1', 'audio1', 'audio2', 'audio2', 'audio3', 'audio3'],
    'text': ['text1', 'text2', 'text3', 'text4', 'text5', 'text6'],
    'login': ['operator1', 'operator2', 'operator3', 'operator4', 'operator5', 'operator6'] 
})

私はそれを次のように集計しようとしています：

x1 = x.groupby('audio')['text'].agg(
    [
    ('text1', lambda x : x.iat[0]),
    ('text2', lambda x : x.iat[1]),
    ('leven', lambda x: Levenshtein.distance(x.iat[0], x.iat[1])) #some function works with grouped text
    ]
).reset_index()

それは機能しますが、グループ化されたログインを行に追加して、次のような行にする必要もあります。

audio, text1, text2, leven, login1, login2

私は何かを試しましたlambda x : x.ait[0, 1]が、うまくいきません

python pandas dataframe

— Contra111
ソース

データは常に順序付けされており、一緒に属する2つの行のペアになっていますか？

— Darkonaut

6

あなたのデータフレームを見ると、私はデータフレームを旋回させることを考えています、以下を使用する私のアプローチであるgroupby().cumcount()とunstack pivottedデータフレームを作成するために、書式設定、一部の列では。

オプション1： 次にdf.apply、機能を適用するために利用できます

m = x.assign(k=x.groupby('audio').cumcount().add(1)).set_index(['audio','k']).unstack()
m.columns=[f"{a}{b}" for a,b in m.columns]
m = m.assign(leven=m.apply(lambda x: 
              Levenshtein.distance(x['text1'],x['text2']),1)).reset_index()

    audio  text1  text2     login1     login2  leven
0  audio1  text1  text2  operator1  operator2      1
1  audio2  text3  text4  operator3  operator4      1
2  audio3  text5  text6  operator5  operator6      1

オプション2： （私はこれを好みます）

リスト内包表記を使用して同じことを行うこともできます。最後の行を次のように置き換えます。

m = x.assign(k=x.groupby('audio').cumcount().add(1)).set_index(['audio','k']).unstack()
m.columns=[f"{a}{b}" for a,b in m.columns]
m = m.assign(leven=[Levenshtein.distance(a,b) for 
               a,b in zip(m['text1'],m['text2'])]).reset_index()

    audio  text1  text2     login1     login2  leven
0  audio1  text1  text2  operator1  operator2      1
1  audio2  text3  text4  operator3  operator4      1
2  audio3  text5  text6  operator5  operator6      1

オプション3：

leven列の位置が重要な場合は、次を使用できますdf.insert。

m=x.assign(k=x.groupby('audio').cumcount().add(1)).set_index(['audio','k']).unstack()
m.columns=[f"{a}{b}" for a,b in m.columns]
m.insert(2,'leven',[Levenshtein.distance(a,b) for a,b in zip(m['text1'],m['text2'])])
m=m.reset_index()

    audio  text1  text2  leven     login1     login2
0  audio1  text1  text2      1  operator1  operator2
1  audio2  text3  text4      1  operator3  operator4
2  audio3  text5  text6      1  operator5  operator6

— 不安な
ソース

1

いいですね、FuzzyWuzzyレーベンシュタイン距離アルゴリズムを使用するために調べてみるとよいかもしれません

— Datanovice

@Datanoviceうん、しかし私はOPがこれをここで使用すると信じています。funcが機能するかどうかに関係なく:)

— 19

1

— 正解

2

これはあなたが探しているものですか？

x1 = x.groupby('audio',)['login'].agg(
     [
     ('operator1', lambda x : x.iat[0]),
     ('operator2', lambda x : x.iat[1]),
     ('leven', lambda x: Levenshtein.distance(x.iat[0], x.iat[1])) #some function works with grouped text
     ]
 ).reset_index()

 x2 = x.groupby('audio',)['text'].agg(
     [
     ('text1', lambda x : x.iat[0]),
     ('text2', lambda x : x.iat[1]),
     ('leven', lambda x: Levenshtein.distance(x.iat[0], x.iat[1])) #some function works with grouped text
     ]
 ).reset_index()

x1.merge(x2)

    audio  operator1  operator2  leven  text1  text2
0  audio1  operator1  operator2      1  text1  text2
1  audio2  operator3  operator4      1  text3  text4
2  audio3  operator5  operator6      1  text5  text6

— ライアン・ハント
ソース

0

このソリューションは、多くの列がある場合にうまく機能します。列を自動的に拡張するため、手動で列をリストする必要はありません。

x = pd.DataFrame({
    'audio': ['audio1', 'audio1', 'audio2', 'audio2', 'audio3', 'audio3'],
    'text': ['text1', 'text2', 'text3', 'text4', 'text5', 'text6'],
    'login': ['operator1', 'operator2', 'operator3', 'operator4', 'operator5', 'operator6'] 
})


text = x.groupby(['audio']).agg(list)['text'].apply(pd.Series).rename(columns=lambda x: f'text{x+1}')

login = x.groupby(['audio']).agg(list)['login'].apply(pd.Series).rename(columns=lambda x: f'login{x+1}')

text['leven'] = df.apply(lambda x: Levenshtein.distance(x.text1, x.text2), axis=1) 

df = text.assign(**login)

        text1  text2  leven     login1     login2
audio                                            
audio1  text1  text2      1  operator1  operator2
audio2  text3  text4      1  operator3  operator4
audio3  text5  text6      1  operator5  operator6

— 抑圧者
ソース

0

次のaggように式を変更するだけです。

x1 = x.groupby('audio').agg({'text':[
    ('text1', lambda x : x.iat[0]),
    ('text2', lambda x : x.iat[1])
    ('leven', lambda x: Levenshtein.distance(x.iat[0], x.iat[1])) #some function works with grouped text
    ],
    'login': [
    ('login1', lambda x : x.iat[0]),
    ('login2', lambda x : x.iat[1])]
    }
).droplevel(0,axis=1).reset_index()

— ステパン
ソース