行数で言うと大きいプレーンテキスト ファイルがあり、それを行数で小さいファイルに分割したいと考えています。つまり、ファイルに約 200 万行ある場合、20 万行のファイル 10 個、または 2 万行のファイル 100 個 (残りは 1 つのファイル。均等に分割できるかどうかは関係ありません) に分割したいと考えています。
Python ではこれをかなり簡単に実行できますが、Bash と Unix ユーティリティを使用してこれを行うための忍者的な方法があるかどうか疑問に思っています (手動でループして行をカウント/分割するのではなく)。
ベストアンサー1
見てみましょう分割コマンド:
バージョン:(GNU coreutils) 8.32
$ split --help
Usage: split [OPTION]... [FILE [PREFIX]]
Output pieces of FILE to PREFIXaa, PREFIXab, ...;
default size is 1000 lines, and default PREFIX is 'x'.
With no FILE, or when FILE is -, read standard input.
Mandatory arguments to long options are mandatory for short options too.
-a, --suffix-length=N generate suffixes of length N (default 2)
--additional-suffix=SUFFIX append an additional SUFFIX to file names
-b, --bytes=SIZE put SIZE bytes per output file
-C, --line-bytes=SIZE put at most SIZE bytes of records per output file
-d use numeric suffixes starting at 0, not alphabetic
--numeric-suffixes[=FROM] same as -d, but allow setting the start value
-x use hex suffixes starting at 0, not alphabetic
--hex-suffixes[=FROM] same as -x, but allow setting the start value
-e, --elide-empty-files do not generate empty output files with '-n'
--filter=COMMAND write to shell COMMAND; file name is $FILE
-l, --lines=NUMBER put NUMBER lines/records per output file
-n, --number=CHUNKS generate CHUNKS output files; see explanation below
-t, --separator=SEP use SEP instead of newline as the record separator;
'\0' (zero) specifies the NUL character
-u, --unbuffered immediately copy input to output with '-n r/...'
--verbose print a diagnostic just before each
output file is opened
--help display this help and exit
--version output version information and exit
The SIZE argument is an integer and optional unit (example: 10K is 10*1024).
Units are K,M,G,T,P,E,Z,Y (powers of 1024) or KB,MB,... (powers of 1000).
Binary prefixes can be used, too: KiB=K, MiB=M, and so on.
CHUNKS may be:
N split into N files based on size of input
K/N output Kth of N to stdout
l/N split into N files without splitting lines/records
l/K/N output Kth of N to stdout without splitting lines/records
r/N like 'l' but use round robin distribution
r/K/N likewise but only output Kth of N to stdout
GNU coreutils online help: <https://www.gnu.org/software/coreutils/>
Full documentation <https://www.gnu.org/software/coreutils/split>
or available locally via: info '(coreutils) split invocation'
$
次のようなことができます:
split -l 200000 filename
これにより、それぞれ 200000 行のxaa xab xac
...という名前のファイルが作成されます。
別のオプションとして、出力ファイルのサイズで分割します (改行で分割されます)。
split -C 20m --numeric-suffixes input_filename output_prefix
output_prefix01 output_prefix02 output_prefix03 ...
それぞれ最大サイズ 20 メガバイトのファイルを作成します。