Юникс-утилиты для работы с данными
Оглавление
Снова и снова смотря (зачем?) на табличку harmful/less-harmful, вижу в ней
|-----------|--------|
| Perl, Ruby|rc, awk |
|-----------|--------|
В целом, окружение юникс имеет достаточно инструментов для работы с данными. Больше того, оно для того и создавалось. AWK на вход ожидает tab-separated строки (ну, типа таблички).
У меня на этот счёт скопилась парочка ссылок. Может кому-нибудь, когда-нибудь…
(мне просто жаль их просто так терять, и хочется поделиться ими с миром)
Using Unix Commands for Data Science
https://matheusrabetti.github.io/data%20analysis/command-line-datascience/
Базово-вводная. От простого к сложному.
И тут есть ссылка на следующую статью. Обозначена она как
Command line tools vs Hadoop
Command-line Tools can be 235x Faster than your Hadoop Cluster
https://adamdrake.com/command-line-tools-can-be-235x-faster-than-your-hadoop-cluster.html На эту статью ссылается и suckless.org. Они её обозначили как
Use of command-line tools for effective data processing – Philosophy, Related links
Солидно. Это что-то, да значит.
Листал, классно посмотреть на конвейеры. Глубоко не вникал.
Why Use Make
https://bost.ocks.org/mike/make/
Встретил её в замечательном блоге про osh/ysh
Действительно, зачем?
tldr;
Makefiles are machine-readable documentation that make your workflow reproducible.
Обработка данных - процесс нелинейный. Скачать файл тут, другой там. Распаковать и совершить преобразования.
Можно, конечно, написать скрипт, но зачем, когда есть готовый инструмент, который 50 лет под рукой и позволяет описать и повторять декларативно это всё как зависимости.
Синтаксис сложный, но для базового использования не обязательно знать его глубоко.