Управление производительностью
Управление производительностью (англ. Capacity management) — система методов и процессов, направленных на обеспечение того, чтобы ресурсы информационных технологий были достаточны для удовлетворения предстоящих бизнес-требований при оптимальных затратах. Одно из общепринятых определений управления производительностью даётся в рамках методологии ITIL. В актуальной версии ITIL 4 эта практика получила название «Управление мощностями и производительностью» (англ. Capacity and performance management) и интегрируется в потоки создания ценности (англ. Value Streams)[1].
По мере изменения характера использования ИТ-сервисов и развития их функциональности, изменяется и объём необходимых ресурсов — центральных процессоров, оперативной памяти, хранилища данных для физических или виртуальных серверов и других компонентов. Например, при скачках нагрузки на вычислительные ресурсы в определённое время суток рекомендуется анализировать происходящее в этот период и вносить изменения для максимального использования текущей ИТ-инфраструктуры: например, оптимизировать приложение или переносить выполнение пакетных заданий на менее загруженные интервалы. Такое планирование производительности позволяет выявить потенциальные проблемы и обосновать инвестиционные решения — например, определение требований к серверам для поддержки будущей загрузки или консолидация центра обработки данных[2].
Данные мероприятия направлены на оптимизацию производительности и эффективности, а также на обоснование финансовых вложений. Управление производительностью включает:
- Мониторинг производительности и пропускной способности (нагрузки) отдельных серверов, серверных ферм или систем в целом
- Анализ производительности на основе собранных данных, включая оценку влияния обновлений на загрузку
- Тюнинг производительности для максимально эффективного использования существующей инфраструктуры
- Анализ требований к сервису и планирование изменений нагрузки (роста или снижения)
- Оценка факторов, влияющих на спрос на вычислительные ресурсы
- Планирование производительности по объёмам необходимых ресурсов: хранилищ, аппаратных и программных компонентов, коммуникационных средств на заданный временной период[3].
Управление производительностью тесно взаимодействует с дисциплиной инженерии производительности — как на этапах проектирования и построения системы, так и при операционном мониторинге.
Рынок и драйверы роста
Ожидается, что к 2033 году объём мирового рынка управления производительностью достигнет 9,7 млрд долларов[4]. Основными драйверами роста рынка являются:
- миграция в облачные и гибридные ИТ-инфраструктуры[4][5];
- внедрение искусственного интеллекта и предиктивной аналитики[5][6];
- усложнение ИТ-инфраструктуры, включая развитие 5G, интернета вещей (IoT), периферийных вычислений и больших данных[4][5];
- потребности сферы здравоохранения, связанные с нехваткой медицинских кадров, ростом числа пациентов и необходимостью оптимизации распределения ресурсов[6][7].
Стратегическое управление ресурсами
В условиях дефицита кадров и ограниченных ресурсов управление производительностью с использованием искусственного интеллекта и аналитики играет ключевую роль в достижении бизнес-целей[8]. Выделяются следующие стратегические задачи и методы их решения:
- Повышение эффективности при ограниченных ресурсах: внедрение HR-аналитики и метрик для оценки влияния инициатив на бизнес-показатели, приоритизация проектов по стратегической значимости, а также использование ИИ и автоматизации для оптимизации рутинных процессов[8].
- Преодоление дефицита специалистов: применение HR-аналитики для предиктивного планирования будущих потребностей и предсказания дефицита навыков, стратегический отбор кандидатов по их потенциалу и развитие внутренних талантов[8].
- Внедрение ИИ и автоматизация HR-процессов: создание стратегии внедрения ИИ с ориентацией на бизнес-цели, обучение команд управлению ИИ и интерпретации данных, а также настройка процессов и метрик для оценки эффективности ИИ-инструментов[8].
Факторы, влияющие на производительность сети
Все сети различаются по устройству и условиям функционирования. При передаче данные разбиваются на составные части (фреймы, пакеты или сегменты), и на эффективность их доставки влияют следующие основные факторы:
- Задержка: срок доставки пакета по всему маршруту может быть немалым. В надёжных протоколах с подтверждением доставки можно измерять этот параметр как время кругового прохождения (round-trip time).
- Джиттер: изменчивость задержки доставки. Низкий джиттер желателен, так как обеспечивает ровный поток пакетов; если джиттер превышает 200 мс, буферы могут опустеть, и данных окажется недостаточно для обработки.
- В современных сетях установлены строгие целевые показатели задержки: для 5G (в рамках стандартов URLLC) она составляет ≤ 1 мс, а для 6G — ≤ 0,1 мс. Важную роль в минимизации задержки играют технологии граничных вычислений (Edge computing), переносящие обработку данных на пограничные узлы[9].
- Порядок приёма: некоторые протоколы (например, для голоса или видео) требуют строгого порядка поступления пакетов; при нарушении порядка часть пакетов может быть отброшена, так как не может быть вставлена в поток уже обработанных данных.
- Потеря пакетов: часть пакетов может теряться из-за ошибок, перегрузки устройств или изменения правил передачи для обеспечения заданного уровня сервиса.
- Повторная передача: при потере пакетов в надёжных сетях они пересылаются заново, что влечёт две задержки — собственно пересылки данных и ожидания получения фрагментов в правильном порядке.
- Пропускная способность: объём данных, который может быть передан по сети, измеряется пропускной способностью (например, в килобитах в секунду); по аналогии — “число полос шоссе“, тогда как задержка — “скоростной лимит“.
Помимо этих факторов, на производительность влияют параметры конечных устройств, сжатие, шифрование, параллельная обработка и другие аспекты. Иногда сеть вообще не справляется с нагрузкой, иногда работает очень медленно, что отрицательно сказывается и на работе прикладных программ, использующих сеть. Для оптимизации производительности всех пользователей применяются различные интеллектуальные средства, такие как формирование трафика, методы которого переходят от статических правил к ИИ-управляемому предиктивному управлению очередями для заблаговременного прогнозирования нагрузки и динамического распределения ресурсов[10].[11]
Дисциплина управления производительностью
Управление производительностью сети (NPM, Network Performance Management) включает измерение, моделирование, планирование и оптимизацию сетей с целью обеспечить такую скорость, надёжность и пропускную способность, которые соответствуют специфике приложений и экономическим возможностям организации. Разные приложения предъявляют разные требования к сочетанию пропускной способности, задержки и отказоустойчивости. Например:
- Потоковое видео или голос допускают небольшие потери, но критична минимальная задержка во избежание лагов.
- Передача крупных файлов и электронная почта должны быть надёжными и обладать высокой пропускной способностью, но не требовательны к мгновенности.
- Обмен мгновенными сообщениями практически не требует широкой полосы, но чувствителен к задержкам и потерям.
Задачи и инструменты управления производительностью сети
Управление производительностью сети является ключевым компонентом модели FCAPS (буква “P“ — Performance, производительность) в стандартах ISO для телекоммуникаций. Эта область позволяет инженерам проактивно выявлять потенциальные проблемы в ИТ-инфраструктуре, повышая, в конечном итоге, качество пользовательского опыта.
Основные задачи специалистов по управлению производительностью сети:
- Измерение производительности: осуществляют на разных уровнях, используя как показатели по отдельным портам (например, сколько трафика прошло по порту 80 между клиентом и сервером, и за какой срок), так и показатели, относящиеся непосредственно к пользователю (например, как быстро загрузилась страница входа для определённого пользователя).
- По портам — данные собираются с помощью мониторинга потоков и протоколов, таких как NetFlow (стандартизирован как IPFIX), либо RMON, а также технологии eBPF, отслеживающей пропускную способность TCP/UDP, активные соединения и потерянные пакеты на уровне ядра Linux без высоких накладных расходов[12].
- Метрики на уровне пользователя — через журналы веб-серверов, синтетический мониторинг, мониторинг реальных пользователей, а также eBPF для детализации трафика по приложениям, системным сервисам и идентификаторам пользователей (UID)[12]. Пример: ART (время отклика приложения), дающее представление о качестве сервиса.
- Судебная экспертиза (forensic analysis): часто применяется использование снифферов, позволяющих разложить сетевые транзакции по протоколам и диагностировать проблемы, такие как повторная передача или сбои на этапах согласования.
- Планирование производительности: моделирующие инструменты, такие как Aria Networks, OPNET, PacketTrap, NetSim, NetFlow и sFlow Analyzer, NetQoS или Klaro Cards[13], позволяют оценить последствия внедрения новых приложений или увеличения нагрузки. По данным Gartner, к 2018 году более 30% предприятий будут использовать такие инструменты для управления критически важной ИТ-инфраструктурой (в 2014 году ими пользовались менее 5%)[14]. Эти средства позволяют командам по инфраструктуре и операционному управлению эффективно планировать ресурсы, оптимизировать инфраструктуру и балансировать использование внешних/облачных сервисов[14].
- Генерация нагрузки: применяется программное или аппаратное обеспечение для искусственного создания трафика с целью определения предельных значений производительности. Некоторые провайдеры предлагают подобные услуги с оплатой по факту используемого трафика для публичных интернет-ресурсов.
- Применение AIOps: использование алгоритмов машинного обучения для прогнозирования аномалий, предиктивного планирования инфраструктуры, динамического распределения ресурсов в реальном времени, а также самовосстановления (self-healing) сети за счёт автономного обнаружения и устранения инцидентов[15][16].
NPM-инструменты нового поколения
Средства следующего поколения для управления производительностью сети автоматизируют сбор сетевых данных, включая вопросы планирования ресурсов, и их анализ. Терри Слэттери (NoJitter.com) анализирует три таких решения — VMWare англ. vRealize Network Insight, PathSolutions TotalView и Kemp Flowmon — в статье Будущее управления производительностью сети. Среди современных Open Source инструментов для управления производительностью в микросервисных и Kubernetes-средах выделяются решения на базе технологии eBPF, такие как Cilium для сетевой наблюдаемости и Pixie для автоматического трассирования приложений[17]. Для комплексного мониторинга также используется Grafana Cloud — управляемый стек наблюдаемости на основе открытых инструментов[18].
Будущее управления производительностью сети
Будущее управления производительностью сетей характеризуется быстрым развитием, отмечает Терри Слэттери (10 июня 2021): «Мы становимся свидетелями появления более глубокого и масштабного анализа сетевых данных, чего не позволяли вычислительные мощности, память и алгоритмы 10–15 лет назад. Новые методы управления сетью помогают быстрее идентифицировать и устранять проблемы… Это действительно интересная и быстроразвивающаяся область». Реализацией глубокого анализа данных выступает технология цифровых двойников сети (Network Digital Twins). Её применение для планирования производительности опирается на интеграцию искусственного интеллекта и машинного обучения, что позволяет не только отображать текущее состояние систем, но и осуществлять предиктивную аналитику — прогнозировать будущие состояния и рекомендовать пути оптимизации[19].[20]
В России
В 2026 году реализация проектов цифровизации и реинжиниринга для управления производительностью на промышленных предприятиях России осуществляется при государственной поддержке в рамках национального проекта «Производительность труда»[21][22]. Цели программы включают развитие цифровизации производства, внедрение лучших практик планирования и поддержку инициатив с использованием цифровых решений[21][22]. Ожидается, что данные меры обеспечат реинжиниринг бизнес-процессов на основе принципов бережливого производства и позволят достичь ежегодного прироста производительности труда не менее чем на 5 %[21][22]. На реализацию проектов повышения производительности Правительство РФ дополнительно направило 196,3 млн рублей из резервного фонда[21][22]. Основной фокус программы направлен на базовые несырьевые отрасли экономики, а также на средние и крупные предприятия[21][22]. Крупнейшими заказчиками проектов цифровизации выступают отрасли со сложными производственными процессами, среди которых металлургия, машиностроение, нефтегазовая и химическая промышленность, а также оборонно-промышленный комплекс[23].