sed を使用したタプルの抽出

sed を使用したタプルの抽出

文字のみで構成される全文をバイグラムに分割する方法です。

たとえば、

奇数と偶数

od -> de
dd -> ev

これは私が今まで持っているものですが、期待した結果は得られません。

[some source] | tail -n +30 | sed 's/[^A-Za-z\n]//g' | sed 's/\([A-Za-z]\)\([A-Za-z]\)\([A-Za-z]\)\([A-Za-z]\)\([A-Za-z]\)\{\0,1\}/\1\2 -> \3\4, \2\3 -> \4\5, /g' | sed 's/,/,\n/g'

ベストアンサー1

次のsedスクリプトを試してください。

コンテンツinfile:

odd even
one test        of              bigrams

コンテンツscript.sed:

## Inside square brackets there are two characters: space and tab.
## The instruction deletes them of the line.
s/[     ]*//g

## Label 'b'.
:b

## Copy line to 'hold space'.
h

## Get first bigram.
s/\(..\)\(..\).*/\1 -> \2/

## If last substitution succeed, continue to label 'a'.
ta

## Here last substitution failed: It means that line has less than four
## characters to extract a bigram, so read next line.
b

## Label 'a'
:a

## Print.
p

## Copy 'hold space' into 'pattern space'.
g

## Delete first character.
s/^.//

## Goto label 'b' to repeat loop.
tb

スクリプトを実行します。

sed -nf script.sed infile

結果:

od -> de
dd -> ev
de -> ve
ev -> en
on -> et
ne -> te
et -> es
te -> st
es -> to
st -> of
to -> fb
of -> bi
fb -> ig
bi -> gr
ig -> ra
gr -> am
ra -> ms

おすすめ記事