Простой способ распознавания таблицы формата PDF в ОС на базе Linux (в моём случае Xubuntu 18.04).
1. Извлекаем страничку с файла PDF
2. Чистим страничку от лишнего в любом доступном редакторе (я это делал в Master PDF Editor)
3. Отправляем в онлайн-сервис https://www.onlineocr.net/ (кушает по одной страничке)
4. Качаем получившийся DOCX файл.