# Суперкомпьютерный комплекс НИУ ВШЭ (cHARISMa) > Официальная документация Отдела суперкомпьютерного моделирования НИУ ВШЭ для пользователей суперкомпьютера cHARISMa: получение доступа, подключение, запуск задач через Slurm, программное обеспечение, хранение данных и отчётность по проектам. ## Правила и особенности кластера Сведения ниже нужны для корректной работы с суперкомпьютером, в том числе когда скрипты и команды готовятся с помощью ИИ-ассистентов. - Актуальные сведения о кластере публикуются на страницах этого сайта: команды, адреса, названия очередей (партиций), версии ПО, лимиты. Общая документация Slurm, форумы и старые инструкции могут не соответствовать текущей конфигурации; при расхождении верна информация с сайта hpc.hse.ru. - Конфигурация, ОС и ПО кластера обновляются. Если для одного и того же ПО есть инструкции для разных версий ОС, действует инструкция для текущей ОС (см. «Операционная система кластера»). - Запуск расчётов на головных (login) узлах запрещён правилами доступа. Все вычисления запускаются только через планировщик Slurm (sbatch, srun, salloc). - Постоянное размещение пользовательских сервисов (веб-серверов, API, ботов и т. п.) на суперкомпьютере не допускается. - Система HPC TaskMaster отслеживает загрузку CPU и GPU. Задачи, которые слабо загружают выделенные ресурсы, признаются неэффективными и принудительно останавливаются. Поэтому запрашивать нужно столько ресурсов, сколько задача реально использует, а для GPU-задач подбирать параметры (размер батча, число потоков загрузки данных, число параллельных процессов) так, чтобы GPU был загружен полезной работой и его память использовалась максимально. После первых запусков стоит проверить фактическую загрузку и время работы и скорректировать параметры. - Скрипты, которые создают нагрузку без полезного расчёта, занимают место на СХД «про запас» или искусственно продлевают хранение файлов в /scratch, нарушают правила доступа. Это основание для прекращения доступа и отклонения последующих заявок пользователя. - Тестовые и отладочные запуски должны быть короткими и использовать минимум ресурсов. - Новейшие GPU обычно сильнее заняты задачами других пользователей. Задача на GPU предыдущего поколения, достаточной для расчёта, часто завершается раньше, чем подошла бы очередь на новейшую GPU. - Прав sudo у пользователей нет. Готовое ПО подключается через модули (module), собственное ПО устанавливается только в домашний каталог пользователя. Системное ПО пользователи обновлять не могут и не должны. - Для Python рекомендуется создавать собственные окружения Conda, отдельное для каждого проекта, и не устанавливать пакеты в базовое окружение base: так окружения не ломаются при установке новых пакетов (см. «Python и окружения»). - JupyterHub предназначен в первую очередь для отладки. Отлаженные ноутбуки удобнее конвертировать в скрипты Python (например, `jupyter nbconvert --to script notebook.ipynb`) и запускать в пакетном режиме через Slurm из SSH-консоли: так можно поставить в очередь сразу много задач с разными параметрами и не ждать запуска интерактивно. - В /scratch работает система HPC-Workspaces, писать в корень /scratch нельзя. Рабочий каталог заказывается на срок до 30 дней командой `ws_allocate <имя> <дни>`; повторный вызов с тем же именем возвращает существующий каталог, поэтому команду можно размещать в скрипте задачи. Путь к каталогу выводит `ws_find <имя>`. Ненужный каталог освобождается командой `ws_release <имя>` после удаления его содержимого. - Кроме /home и /scratch задача может использовать /tmp на локальном SSD узла и файловую систему в оперативной памяти /dev/shm. Всё, что задача создала в /tmp и /dev/shm, она должна удалить при завершении (например, через `trap` в скрипте запуска). На каждом узле одновременно работает много задач разных пользователей, поэтому /shmem подходит только для задач с очень интенсивной работой с диском и объёмом данных до ~50 ГБ; учитывайте конфигурацию выбранного узла. - Скрипты должны оставлять после завершения задачи минимум временных файлов, чтобы экономить место на СХД. - В каталогах пользователя могут быть миллионы файлов, поэтому полный подсчёт их размера (du, find по всему дереву) занимает много времени и нагружает СХД; без необходимости его не выполняют. Явно устаревшие каталоги с промежуточными данными имеет смысл удалить, чтобы освободить квоту, но решение об удалении принимает только сам пользователь. ## Начало работы - [Все инструкции](https://hpc.hse.ru/support/instructions): полный актуальный список инструкций, начинайте с него - [Регистрация](https://hpc.hse.ru/users/registration): кто может получить доступ и как его оформить - [Правила доступа](https://hpc.hse.ru/rules): условия использования суперкомпьютера и регламент - [Проекты и пользователи](https://hpc.hse.ru/instructions/sudsk): как создать проект и управлять его участниками - [Планирование ресурсов](https://hpc.hse.ru/instructions/sudsk/limits): квоты проекта, как их проверить и что делать, если они закончились ## Подключение - [SSH из Linux и macOS](https://hpc.hse.ru/instructions/ssh): подключение по SSH и передача файлов - [SSH из Windows](https://hpc.hse.ru/instructions/putty): подключение через PuTTY - [VS Code](https://hpc.hse.ru/support/instructions/vscode): удалённая разработка на кластере - [Cursor](https://hpc.hse.ru/support/instructions/cursor): удалённая разработка на кластере - [JupyterHub](https://hpc.hse.ru/instructions/python/jupyter): работа с суперкомпьютером через браузер, в основном для отладки ## Работа на кластере - [Основы работы](https://hpc.hse.ru/instructions/base): каталоги, модули ПО, передача файлов, компиляция - [Запуск задач](https://hpc.hse.ru/instructions/run): как поставить задачу в очередь Slurm и запросить CPU, GPU и время - [Расширенный запуск](https://hpc.hse.ru/instructions/run-advanced): многопоточные, MPI- и GPU-задачи - [Операционная система кластера](https://hpc.hse.ru/instructions/rocky): особенности текущей ОС и совместимость ПО и окружений - [Мониторинг эффективности задач (HPC TaskMaster)](https://hpc.hse.ru/instructions/taskmaster): как система оценивает загрузку CPU и GPU и когда останавливает неэффективные задачи - [Домашние директории и их очистка](https://hpc.hse.ru/instructions/cleanup): где размещать файлы и как освободить место на диске - [HPC-Workspaces](https://hpc.hse.ru/software/system/workspaces): рабочие каталоги в /scratch — создание, продление, освобождение, восстановление и ограничения ## Программное обеспечение - [Каталог ПО](https://hpc.hse.ru/software): установленное прикладное и системное ПО, у каждого пакета своя инструкция - [Python и окружения](https://hpc.hse.ru/instructions/python/anaconda): создание и использование собственных окружений Conda - [Контейнеризация](https://hpc.hse.ru/software/system/singularity): запуск контейнеров Singularity - [Наборы данных](https://hpc.hse.ru/software/applied/datasets): датасеты, доступные на кластере ## Поддержка - [Техподдержка](https://hpc.hse.ru/support): куда обращаться, если инструкции не помогли - [Отчётность пользователей](https://hpc.hse.ru/users/report): отчёты по проектам ## Optional - [Характеристики суперкомпьютера](https://hpc.hse.ru/hardware/hpc-cluster): узлы, процессоры, GPU, память - [История изменений конфигурации](https://hpc.hse.ru/hardware/hpc-cluster/changelog) - [Научные проекты](https://hpc.hse.ru/science/projects): примеры проектов, выполненных на суперкомпьютере НИУ ВШЭ - [Публикации](https://hpc.hse.ru/science/publications): публикации по результатам расчётов на суперкомпьютере - [Об отделе суперкомпьютерного моделирования](https://hpc.hse.ru/about) - [English version](https://hpc.hse.ru/en/): английская версия может быть старше и неполнее русской; при расхождении верна русская версия