Юникс-утилиты для работы с данными

· 2 мин. чтения
Оглавление

Снова и снова смотря (зачем?) на табличку harmful/less-harmful, вижу в ней

|-----------|--------|
| Perl, Ruby|rc, awk |
|-----------|--------|

В целом, окружение юникс имеет достаточно инструментов для работы с данными. Больше того, оно для того и создавалось. AWK на вход ожидает tab-separated строки (ну, типа таблички).

У меня на этот счёт скопилась парочка ссылок. Может кому-нибудь, когда-нибудь…
(мне просто жаль их просто так терять, и хочется поделиться ими с миром)

Using Unix Commands for Data Science

https://matheusrabetti.github.io/data%20analysis/command-line-datascience/

Базово-вводная. От простого к сложному.

И тут есть ссылка на следующую статью. Обозначена она как

Command line tools vs Hadoop

Command-line Tools can be 235x Faster than your Hadoop Cluster

https://adamdrake.com/command-line-tools-can-be-235x-faster-than-your-hadoop-cluster.html На эту статью ссылается и suckless.org. Они её обозначили как

Use of command-line tools for effective data processing – Philosophy, Related links

Солидно. Это что-то, да значит.

Листал, классно посмотреть на конвейеры. Глубоко не вникал.

Why Use Make

https://bost.ocks.org/mike/make/

Встретил её в замечательном блоге про osh/ysh

Действительно, зачем?

tldr;

Makefiles are machine-readable documentation that make your workflow reproducible.

Обработка данных - процесс нелинейный. Скачать файл тут, другой там. Распаковать и совершить преобразования.

Можно, конечно, написать скрипт, но зачем, когда есть готовый инструмент, который 50 лет под рукой и позволяет описать и повторять декларативно это всё как зависимости.

Синтаксис сложный, но для базового использования не обязательно знать его глубоко.