Энергетическая стоимость компилируемого анализатора на основе правил и анализаторов на языковых моделях для мгновенной оценки состояния здоровья

Авторский коллектив

  1. Прозоров А.А., Директор по технологиям РТЛАБ, архитектор Сбертех, ap@rtlab.ru;

Аннотация

Цель: В статье сравниваются три варианта реализации анализатора для мгновенной оценки состояния здоровья по потреблению электроэнергии на единицу работы, нормированному к джоулям на пациенто-час (Дж/пациенто-час): большой анализатор на языковой модели со смесью экспертов (MoE), малый анализатор на тщательно настроенной языковой модели и компилируемый анализатор на основе правил на C++. Единица работы — один час анализа в реальном времени для одного пациента по непрерывному потоку 12-канальной электрокардиограммы (ЭКГ) с частотой дискретизации 500 Гц на отведение плюс именованные термины электролитов, обновляющиеся не чаще одного раза в 30 минут.

Материалы и методы: Статья является методологической модельной работой с прозрачной формулой учёта энергии. Она задаёт шлюз функциональной сопоставимости, общий конвейер подготовки сигнала, относимый одинаково ко всем вариантам, разложение времени выполнения компилируемого анализатора на мощность общей подготовки и приращение оценки правил, обязательный детерминированный этап валидатора, относимый к вариантам на языковых моделях, и повторяющийся этап повторной валидации, отражающий дрейф модели и подсказки. Внешние источники задают диапазоны энергии вывода, энергию обучения по жизненному циклу, дисциплину измерения для бенчмарков и мощности, конверты мощности ускорителей и накладные расходы центров обработки данных [1-13].

Результаты: Ранжирование стабильно во всём моделируемом диапазоне: для требуемой трассируемой, производящей доказательства и пригодной к аудиту рабочей нагрузки компилируемый анализатор на основе правил на C++ имеет наименьшую энергию выполнения на один-два порядка. В полном по шлюзу базовом сценарии энергия выполнения составляет около 3 600 Дж/пациенто-час для компилируемого анализатора, 59 400 Дж/пациенто-час для малого варианта на языковой модели и 545 400 Дж/пациенто-час для большого варианта MoE. После амортизации подготовки, адаптации или авторской разработки, готовности к выпуску, повторяющейся повторной валидации и аудита по 1 000 000 пациенто-часов базовые оценки становятся около 7 200 Дж/пациенто-час, 117 000 Дж/пациенто-час и 768 600 Дж/пациенто-час соответственно, или примерно 1,0x, 16x и 107x относительно компилируемого анализатора. Это модельные оценки, а не измеренные продуктовые утверждения.

Заключение: Для этой конкретной прикроватной рабочей нагрузки горячий путь узкий, непрерывный, привязанный к доказательствам и детерминированный, и такая форма благоприятствует компилируемым правилам и детерминированному вычислительному ядру. Варианты на языковых моделях лучше размещать рядом с горячим путём: для поддержки авторской разработки правил, офлайн-кластеризации, рецензируемого объяснения наблюдений и правил-кандидатов для управляемого уточнения графа знаний.

Ключевые слова: энергоэффективность; компилируемый анализатор на основе правил; детерминированное вычислительное ядро; энергия вывода языковой модели; смесь экспертов; амортизация энергии по жизненному циклу; мгновенная оценка состояния здоровья; 12-канальная ЭКГ; пригодные к аудиту доказательства; джоули на пациенто-час

Сокращения и терминология

Анализатор: Программный модуль или сервис, который потребляет ограниченную рабочую нагрузку анализа и выдаёт ограниченные находки с доказательствами. В этой статье термин охватывает все три сравниваемых варианта независимо от внутреннего механизма.

Компилируемый анализатор на основе правил на C++: Проектно-нативный вариант, в котором авторизованная семантика компилируется в выпущенный пакет, исполняемый детерминированным вычислительным ядром по ограниченным окнам, производя доказательства выполнения и долговечный аудит. «На основе правил» означает, что поведение задаётся явными правилами или скомпилированным исполняемым знанием, а не непрозрачным решением модели.

Большой анализатор на языковой модели MoE: Вариант, использующий большую разреженную модель со смесью экспертов для интерпретации на уровне окна по компактным сводкам признаков и текущим именованным терминам, требующий полного стека обслуживания.

Малый анализатор на тщательно настроенной языковой модели: Вариант, использующий компактную доменно-настроенную модель или ограниченный классификатор/генератор по структурированным признакам, способный работать на ускорителях меньшей мощности или оптимизированных путях CPU.

Вычислительное ядро: Детерминированный компонент исполнения, который исполняет один нормализованный запрос по валидированному каталогу в памяти и возвращает детерминированный ответ и доказательства.

Слой валидатора: Детерминированный компонент, который отображает любой вывод анализатора в авторизованную идентичность термина, ограниченные состояния кардио-флагов и опубликованные доказательства. Компилируемый анализатор сам является этим слоем; вариант на языковой модели обязан добавить его как отдельный обязательный проход, чтобы удовлетворить шлюзу сопоставимости.

Пациенто-час: Единица нормировки, один час непрерывного анализа в реальном времени для одного пациента.

Окно и шаг: Длина скользящего окна анализа и сдвиг между последовательными окнами. Базовый случай использует окно длиной 10 секунд с шагом 1 секунда, что даёт 3 600 вызовов анализатора на пациенто-час.

Энергия выполнения: Электроэнергия, используемая для обслуживания одного пациенто-часа, когда вариант готов, включая общую подготовку сигнала, вычисление, специфичное для варианта, слой валидатора и публикацию доказательств.

Амортизированная по жизненному циклу энергия: Энергия выполнения плюс энергия подготовки, обучения или авторской разработки, компиляции и выпуска, готовности, повторяющейся повторной валидации и аудита, делённая на масштаб развёртывания в пациенто-часах.

Шлюз функциональной сопоставимости: Набор поведенческих обязательств, которым вариант должен соответствовать, чтобы его число энергии было сопоставимым: тот же объём входа, тот же класс ограниченного выхода, трассируемость, публикация доказательств, пригодность к аудиту и отсутствие клинического утверждения.

Общий конвейер подготовки сигнала: Общий слой приёма по протоколу, валидации и нормализации отведений, проверок качества сигнала, извлечения признаков, временного выравнивания и упаковки доказательств, относимый одинаково ко всем вариантам.

PUE (Power Usage Effectiveness): Множитель центра обработки данных, преобразующий энергию информационных технологий в энергию объекта, включая охлаждение, источники бесперебойного питания и сеть.

1. Постановка задачи

Задача анализатора — сценарий мгновенной оценки состояния здоровья: интерпретация в реальном времени смеси именованных терминов и осциллограмм. Конкретный вход — непрерывный поток 12-канальной ЭКГ с дискретизацией каждого отведения на 500 Гц; именованные термины электролитов, в частности натрий, кальций и магний, при этом внутренний нарратив ЭКГ также обсуждает калий, магний и кальций как контекст ритма и морфологии; обновления значений терминов происходят не чаще одного раза в 30 минут; и выход в виде ограниченных кардио-флагов, исключений, неподдерживаемых состояний, неразрешённых состояний, доказательств выполнения, ссылок аудита и передачи в диагностический контур.

Смежная статья об интерпретации ЭКГ определяет именованные термины как управляемые клинические, сигнальные, лабораторные или интерпретационные термины со стабильной идентичностью и текущими значениями, определяет осциллограммы ЭКГ как непрерывный сигнальный материал 12 отведений в реальном времени и определяет кардио-флаги как ограниченные интерпретационные выходы, а не автономные диагнозы. Смежная статья о потоковом анализаторе определяет скользящие окна, упорядочение по времени событий, водяные знаки, политику запаздывающих данных и проекцию потоковых доказательств. Смежная статья об анализаторе без сохранения состояния определяет хост сервиса в пределах запроса, декодер, подготовку именованных признаков, вызов вычислительного ядра и поверхности публикации для ограниченных окон 12-канальной ЭКГ. Эти рукописи являются внутренним обоснованием модели задачи и перечислены в разделе «Авторская основа».

2. Шлюз функциональной сопоставимости

Числа энергии осмысленны, только если варианты выполняют сопоставимую работу. Вариант сопоставим, только если он проходит все следующие шлюзы.

Шлюз Требуемое поведение
Тот же объём входа Анализатор потребляет ту же рабочую нагрузку пациенто-часа: поток 12-канальной ЭКГ, текущие именованные термины электролитов и объявленную политику окон.
Тот же класс выхода Анализатор выдаёт ограниченные находки: кардио-флаг, исключение, отсутствие, неподдерживаемое или неразрешённое.
Трассируемость Каждый выход несёт идентичность именованного термина, ссылку на термин времени выполнения там, где применимо, контекст значения термина, идентичность выпуска правила или модели и ссылку на сигнальные доказательства.
Публикация доказательств Анализатор производит поверхности результата, аудита, отладки или объяснения, отказа, метрик и доказательств выполнения, соответствующие его архитектуре.
Пригодность к аудиту Долговечный аудит не реконструируется из трасс отладки; доказательства можно воспроизвести или рецензировать относительно акцептованной основы выпуска.
Отсутствие клинического утверждения Результат не трактуется как автономная диагностика, регуляторная валидация или независимое клиническое решение.

Если вариант на языковой модели производит правдоподобную прозу, но не может приложить стабильные ссылки на именованные термины, идентичность выпуска, ссылки на доказательства и пригодные к аудиту состояния решений, он не проходит шлюз сопоставимости. Его энергия всё ещё может быть интересна, но она несопоставима с управляемой рабочей нагрузкой анализатора. У шлюза есть прямое энергетическое следствие, развиваемое в разделе 6: вариант на языковой модели обязан выполнить детерминированный проход валидатора, чтобы преобразовать свободный вывод в управляемые состояния и доказательства, и этот проход не является опциональным.

3. Надёжность источников

Отчёт использует четыре уровня доказательности. Уровень A — внутренние проектные нарративы и спецификации, задающие задачу, границы полномочий, обязательства по доказательствам и архитектуру времени выполнения на C++. Уровень B — рецензируемые или стандартоподобные внешние источники, обосновывающие энергию по жизненному циклу и диапазоны энергии вывода. Уровень C — отраслевые бенчмарки и спецификации производителей, обосновывающие методологию бенчмарков, контекст пропускной способности и конверты мощности оборудования. Уровень D — недавние препринты и модельные допущения, используемые только для рамки чувствительности и всегда помеченные как таковые.

Важные внешние источники включают измерение энергии вывода для конкретных задач, показывающее, что генерация текста гораздо более энергоёмка, чем классификация текста [2]; оценку энергии обучения по жизненному циклу для большой публичной модели [3]; стандартизованный бенчмаркинг вывода и конкретную дисциплину измерения мощности с использованием внешних анализаторов мощности [4][5][6]; конверты мощности ускорителей только для контекста [7][8]; контекст накладных расходов центров обработки данных и PUE [9][10]; рамку «интеллект на джоуль» [1]; и недавние препринты по производству энергии в токены, маршрутизации по длине контекста и диагностике энергии вывода [11][12][13], которые не трактуются как устоявшиеся измеренные факты.

4. Модель входной рабочей нагрузки

4.1 Размер сырого потока

Размер потока ЭКГ:

12 отведений x 500 отсчётов/с = 6 000 отсчётов/с
6 000 отсчётов/с x 3 600 с/час = 21 600 000 отсчётов/час
21 600 000 отсчётов/час x 2 байта/отсчёт = 43 200 000 байт/час

Базовый сырой поток напряжения составляет поэтому около 43,2 МБ/пациенто-час до метаданных, аннотаций качества, производных признаков, сжатия, транспортного обрамления и ссылок на доказательства.

4.2 Окна

Базовый режим окон использует длину окна 10 секунд, шаг 1 секунда и 3 600 вызовов на пациенто-час. Случаи чувствительности варьируют шаг.

Режим Окно Шаг Вызовов на пациенто-час
Низкочастотный обзор 10 с 10 с 360
Базовый обзор в реальном времени 10 с 1 с 3 600
Высокочастотный обзор 10 с 0,5 с 7 200

Именованные термины электролитов разрежены по сравнению с ЭКГ. Если значения обновляются не чаще одного раза в 30 минут, каждый электролит имеет не более двух обновлений на пациенто-час. Их влияние на энергию определяется выравниванием доказательств и привязкой аудита, а не объёмом числового входа.

5. Общий конвейер подготовки сигнала

Честное сравнение не просит языковую модель читать сырую ЭКГ как текст в основном сценарии. Все три варианта используют общий слой подготовки сигнала: приём по протоколу и идентичность источника или сессии; валидацию, упорядочение, нормализацию единиц и политику частоты дискретизации отведений; проверки качества сигнала и флаги артефактов; извлечение признаков для ритма, интервалов, морфологии и сводок каналов; временное выравнивание окон ЭКГ с текущими именованными терминами электролитов; и упаковку доказательств со ссылками, хешами и контекстом выпуска.

Этот общий слой предотвращает ложное сравнение, в котором компилируемый анализатор получает структурированные признаки, а языковая модель — произвольно дорогое кодирование сырого сигнала. У него также есть важное учётное следствие, используемое в этой статье: поскольку мощность общей подготовки относится одинаково ко всем вариантам, она является нижней границей для всех трёх чисел и относительно большой долей итога компилируемого анализатора, но пренебрежимой долей итогов языковых моделей. Компилируемый анализатор выглядит дешёвым не потому, что он пропускает подготовку, а потому, что его специфичное для варианта приращение над общей подготовкой мало. Отдельный анализ антипаттерна для токенизации сырой ЭКГ приведён в разделе 11.4.

6. Формула учёта энергии

Отчёт использует член времени выполнения плюс амортизированный фиксированный член:

E_итог_на_пациенто_час =
  E_выполнение_на_пациенто_час
  + (E_подготовка
     + E_обучение_или_авторство
     + E_компиляция_выпуск
     + E_готовность
     + E_повторная_валидация_итог
     + E_аудит) / N_пациенто_часов

E_выполнение_на_пациенто_час =
  E_общая_подготовка
  + E_вычисление_варианта
  + E_валидатор
  + E_публикация_доказательств

Где E_общая_подготовка — энергия общей подготовки сигнала, относимая ко всем вариантам; E_вычисление_варианта — оценка правил для компилируемого анализатора или вывод модели для вариантов на языковых моделях; E_валидатор — детерминированный проход, отображающий вывод в авторизованные термины, ограниченные состояния и опубликованные доказательства, который встроен в компилируемый анализатор и является добавленным обязательным проходом для вариантов на языковых моделях; E_публикация_доказательств — запись результата, аудита и доказательств выполнения; E_подготовка включает курирование наборов данных, тестовые фикстуры, корпуса воспроизведения и материалы подготовки признаков; E_обучение_или_авторство — обучение или дообучение модели для языковых моделей либо формализация правил и авторская разработка сценариев для компилируемого анализатора; E_компиляция_выпуск покрывает компиляцию, упаковку, доказательства выпуска и готовность к развёртыванию; E_готовность покрывает наборы регрессии, тесты воспроизведения, приёмочные стенды и прогоны бенчмарков; E_повторная_валидация_итог покрывает повторяющуюся повторную приёмку после изменений модели, подсказки, схемы признаков или правил в течение жизненного цикла развёртывания; E_аудит покрывает энергию вычислений, хранения, индексирования, воспроизведения и генерации отчётов для контура аудита; а N_пациенто_часов — масштаб коммерческой эксплуатации, по которому амортизируется фиксированная энергия.

Время рецензента-человека не переводится в джоули. Учитывается только электроэнергия, используемая вычислениями, хранением, сетью, ускорителем и инфраструктурой.

7. Использованные коэффициенты

7.1 Литературные и аппаратные опорные точки

Величина Использованное значение Статус источника
Энергия классификации текста около 0,002 кВт·ч / 1 000 выводов, или 7,2 Дж/вывод Сообщено измерением энергии вывода для конкретных задач [2].
Энергия генерации текста около 0,047 кВт·ч / 1 000 выводов, или 169,2 Дж/вывод Сообщено измерением энергии вывода для конкретных задач [2].
Опорная точка обучения большой модели 433 196 кВт·ч динамической электроэнергии для одного публичного прогона обучения модели на 176 млрд параметров Сообщённый анализ жизненного цикла [3]; вклад простоя и воплощённой энергии дополнителен.
TDP H100 SXM до 700 Вт конфигурируемо Спецификация продукта производителя [7].
TDP L4 72 Вт Спецификация продукта производителя [8].
Среднеотраслевой PUE 1,56 базовый, 1,2 чувствительность для эффективного гиперскейла Отраслевой обзор и контекст агентства [9][10]; применяется только к облачным или ЦОД-вариантам.

7.2 Модельные допущения

Следующие коэффициенты являются модельными допущениями для этого отчёта, выбранными консервативными и прозрачными, а не ложно точными. Они относятся к уровню D.

Величина Низкий Базовый Высокий Интерпретация
Мощность общей подготовки сигнала (все варианты) 0,25 Вт (900 Дж/час) 0,5 Вт (1 800 Дж/час) 1,5 Вт (5 400 Дж/час) Непрерывная фильтрация, детекция ударов, морфология и извлечение признаков на 6 000 отсчётов/с на встраиваемом или серверном ядре.
Приращение оценки правил компилируемого анализатора 0,07 Вт (250 Дж/час) 0,5 Вт (1 800 Дж/час) 3,5 Вт (12 600 Дж/час) Ограниченная оценка правил и исключений плюс запись доказательств и аудита над общей подготовкой.
Вывод малой языковой модели 2 Дж/окно 15 Дж/окно 80 Дж/окно От оптимизированной ограниченной классификации через компактную структурированную генерацию до менее эффективного обслуживания.
Вывод большой MoE 20 Дж/окно 150 Дж/окно 1 000 Дж/окно От эффективного обслуживания MoE через обслуживание, подобное генерации, до длинного контекста или обслуживания с низкой утилизацией.
Проход валидатора (только варианты на языковых моделях) 0,5 Дж/окно 1 Дж/окно 2 Дж/окно Детерминированное отображение вывода модели в авторизованные термины, ограниченные состояния и опубликованные доказательства.

Время выполнения компилируемого анализатора есть сумма общей подготовки и приращения оценки правил: при базе 1 800 + 1 800 = 3 600 Дж/час, что равно среднему 1 Вт, из которых только половина — приращение, специфичное для анализатора. Базовый коэффициент большой MoE близок к опорной точке энергии генерации текста [2]; выбор намеренный и обсуждается как прокси в разделе 9. Базовый коэффициент малой языковой модели примерно вдвое выше опорной точки классификации текста [2], оставляя место для упаковки признаков и структурированного вывода. База валидатора 1 Дж/окно намеренно установлена на уровне или выше всего приращения оценки правил компилируемого анализатора 0,5 Дж/окно, чтобы сравнение не занижало обязательство языковой модели; см. раздел 8.1.

7.3 Допущения по фиксированной энергии жизненного цикла

Вариант Низкая Базовая Высокая Включённая работа
Внедрение большой MoE 5 000 кВт·ч 30 000 кВт·ч 150 000 кВт·ч Подготовка наборов данных, доменная адаптация, валидация, готовность к выпуску, рабочие процессы доказательств и аудита.
Повторяющаяся повторная валидация большой MoE 8 000 кВт·ч 32 000 кВт·ч 120 000 кВт·ч Повторная приёмка после изменений модели, подсказки или схемы признаков в течение жизненного цикла развёртывания (раздел 8.2).
Внедрение малой языковой модели 500 кВт·ч 8 000 кВт·ч 40 000 кВт·ч Подготовка доменных данных, дообучение, квантование и оценка, готовность к выпуску, рабочие процессы аудита.
Повторяющаяся повторная валидация малой языковой модели 2 000 кВт·ч 8 000 кВт·ч 30 000 кВт·ч Повторная приёмка после настройки, изменений подсказки или схемы признаков в течение жизненного цикла развёртывания.
Компилируемый на основе правил на C++ 100 кВт·ч 1 000 кВт·ч 5 000 кВт·ч Поддержка авторской разработки правил, компиляция, регрессия, детерминированное воспроизведение, доказательства выпуска, рабочие процессы аудита; детерминированная повторная приёмка при изменении правил ограничена и уже включена здесь.
Стресс-надбавка полного предобучения большой модели 433 196 кВт·ч 433 196 кВт·ч 2 000 000 кВт·ч Отдельный сценарий владения, не основной случай внедрения. Низкое и базовое значение — только динамическая электроэнергия обучения [3]; более широкая инфраструктура и энергия простоя увеличили бы его.

Основной сценарий языковой модели — использование предобученной модели плюс доменная адаптация. Полное предобучение приводится отдельно, потому что это другая бизнес- и инженерная граница.

8. Два члена усиления

Этот раздел делает явными два энергетических обязательства, которые неформальные сравнения обычно опускают, и оба расширяют, а не сужают преимущество компилируемого анализатора.

8.1 Обязательный проход валидатора

Шлюз сопоставимости (раздел 2) требует управляемого вывода: стабильную идентичность термина, ограниченные состояния кардио-флагов и опубликованные доказательства. Компилируемый анализатор производит их напрямую; это его нативный вывод. Вариант на языковой модели производит токены, и эти токены должны быть разобраны, ограничены, отображены в авторизованные термины, проверены относительно ограниченных состояний и превращены в доказательства детерминированным валидатором. Этот валидатор сам является небольшим механизмом правил. Отнесение его к базе 1 Дж/окно консервативно, потому что оно установлено на уровне или выше всего приращения оценки правил компилируемого анализатора 0,5 Дж/окно. Следствие резкое: ещё до учёта какого-либо вывода проходящий шлюз вариант на языковой модели платит за окно больше за апостериорную валидацию, чем компилируемый анализатор платит за всё своё аналитическое приращение. Валидатор нельзя удалить, не провалив шлюз, поэтому он относится к энергии выполнения для вариантов на языковых моделях.

8.2 Повторяющаяся повторная валидация

Детерминированные компилируемые правила меняются только при изменении авторизованной семантики, и изменение — это детерминированная перекомпиляция с ограниченной регрессией и детерминированным воспроизведением, уже учтённая в фиксированной энергии компилируемого анализатора. Поведение языковой модели чувствительно к изменениям настройки, подсказки, контекста и схемы признаков и может незаметно деградировать, когда любой из них дрейфует от допущений обучения. Каждое такое изменение запускает цикл повторной приёмки: наборы регрессии, корпуса воспроизведения и прогоны бенчмарков должны быть выполнены повторно, чтобы заново установить основу выпуска. Моделирование восьми циклов повторной валидации в течение развёртывания, производящего 1 000 000 пациенто-часов, при половине базовой энергии внедрения за цикл добавляет 32 000 кВт·ч для большого варианта MoE и 8 000 кВт·ч для малого варианта. Компилируемый анализатор не несёт эквивалентного повторяющегося штрафа, потому что его повторная приёмка детерминирована и ограничена.

9. Базовый коэффициент MoE — это прокси генерации

Базовый коэффициент большой MoE 150 Дж/окно намеренно установлен близко к измеренной опорной точке энергии генерации текста [2], а не выведен из измеренной трассы обслуживания MoE. Это выбор прокси, и он указан как таковой. Причина двойная. Во-первых, публичной измеренной энергии обслуживания MoE для именно этой рабочей нагрузки не существует, и наиболее защитимая публичная опорная точка для интерпретационного вывода на уровне окна — задача генерации. Во-вторых, препринт о топологии маршрутизации [12] даёт аналитический пример токенов на ватт для MoE, но явно исключает накладные расходы диспетчеризации MoE, поэтому он не может служить измеренной базой. Использование опорной точки генерации поэтому консервативно по форме и честно по происхождению: оно не заявляет измеренное число MoE и не опирается на препринт, опускающий стоимость диспетчеризации. Чувствительность к этому выбору ограничена низким и высоким коэффициентами в разделе 7.2.

10. Результаты

10.1 Энергия выполнения, полная по шлюзу база

Энергия выполнения исключает фиксированную подготовку. Полная по шлюзу модель добавляет общую подготовку ко всем вариантам и проход валидатора к вариантам на языковых моделях.

Вариант Состав (база) База выполнения Относительно компилируемого
Компилируемый на основе правил на C++ 1 800 подготовка + 1 800 оценка правил 3 600 Дж (1,0 Вт·ч) 1,0x
Малая языковая модель 1 800 подготовка + 54 000 вывод + 3 600 валидатор 59 400 Дж (16,5 Вт·ч) 16,5x
Большая MoE 1 800 подготовка + 540 000 вывод + 3 600 валидатор 545 400 Дж (151,5 Вт·ч) 151,5x

Для сравнения с неформальными формулировками только по выводу отношения только по выводу составляют около 15x и 150x; полные по шлюзу отношения немного выше, потому что проход валидатора обязателен. Низкий и высокий диапазоны выполнения следуют коэффициентам раздела 7.2.

Вариант Низкий Базовый Высокий
Компилируемый на основе правил на C++ 1 150 Дж (0,32 Вт·ч) 3 600 Дж (1,0 Вт·ч) 18 000 Дж (5,0 Вт·ч)
Малая языковая модель 9 900 Дж (2,75 Вт·ч) 59 400 Дж (16,5 Вт·ч) 300 600 Дж (83,5 Вт·ч)
Большая MoE 75 600 Дж (21,0 Вт·ч) 545 400 Дж (151,5 Вт·ч) 3 610 800 Дж (1 003,0 Вт·ч)

10.2 Амортизированная по жизненному циклу энергия при 1 000 000 пациенто-часов

Амортизированная фиксированная энергия на пациенто-час есть фиксированная энергия в киловатт-часах, умноженная на 3,6 Дж при этом масштабе. Фиксированная энергия языковых моделей теперь включает повторяющуюся повторную валидацию (раздел 8.2).

Вариант База выполнения Фиксированная (внедрение + повторная валидация) Амортизированная фиксированная База жизненного цикла Относительно
Компилируемый на основе правил на C++ 3 600 Дж 1 000 кВт·ч 3 600 Дж 7 200 Дж (2,0 Вт·ч) 1,0x
Малая языковая модель 59 400 Дж 16 000 кВт·ч 57 600 Дж 117 000 Дж (32,5 Вт·ч) 16,3x
Большая MoE 545 400 Дж 62 000 кВт·ч 223 200 Дж 768 600 Дж (213,5 Вт·ч) 106,8x

Члены усиления расширяют преимущество относительно трактовки только по выводу: база компилируемого анализатора не изменилась на 7 200 Дж/пациенто-час, тогда как базы малой и большой языковых моделей поднимаются примерно до 16x и 107x, потому что теперь учтены проход валидатора и повторяющаяся повторная валидация.

10.3 Чувствительность к масштабу

Масштаб развёртывания Компилируемый на основе правил на C++ Малая языковая модель Большая MoE Большая MoE плюс стресс предобучения
10 000 пациенто-часов 363 600 Дж (101,0 Вт·ч) 5 819 400 Дж (1 616,5 Вт·ч) 22 865 400 Дж (6 351,5 Вт·ч) 178 000 000 Дж (49 444 Вт·ч)
1 000 000 пациенто-часов 7 200 Дж (2,0 Вт·ч) 117 000 Дж (32,5 Вт·ч) 768 600 Дж (213,5 Вт·ч) 2 328 600 Дж (646,8 Вт·ч)
100 000 000 пациенто-часов 3 636 Дж (1,01 Вт·ч) 59 976 Дж (16,66 Вт·ч) 547 632 Дж (152,12 Вт·ч) 561 232 Дж (155,9 Вт·ч)

Малые развёртывания определяются энергией подготовки, валидации и повторной валидации. Очень большие развёртывания определяются энергией выполнения. Ранжирование никогда не переворачивается при базовых допущениях.

10.4 Почему 1 000 000 пациенто-часов — это заголовочный масштаб

Заголовочный масштаб не произволен. Один миллион пациенто-часов — это около 114 пациенто-лет непрерывного анализа. Среднеразмерное развёртывание интенсивной терапии на 20 мониторируемых койках при примерно 70-процентной занятости производит порядка 120 000 пациенто-часов в год, поэтому один миллион пациенто-часов соответствует примерно восьми годам эксплуатации одной площадки или примерно одному году в небольшой сети из восьми сопоставимых отделений. Это масштаб, на котором управляемое клиническое развёртывание является действующим предприятием, а не пилотом, поэтому он используется для заголовка, и поэтому для контраста в разделе 10.3 показаны как пилотный, так и очень большой масштаб.

11. Анализ чувствительности

11.1 Шаг окна

Время выполнения языковой модели масштабируется приблизительно с числом вызовов, когда каждое окно вызывает отдельную подсказку и проход валидатора. Время выполнения компилируемого варианта может масштабироваться сублинейно, потому что извлечение признаков потоковое, а оценка правил переиспользует состояние, но высокий случай оставлен достаточно широким, чтобы покрыть более частые окна.

Режим окна Вызовов/час Малая база (15 Дж + 1 Дж валидатор) База большой MoE (150 Дж + 1 Дж валидатор)
Шаг 10 с 360 5 760 Дж (1,6 Вт·ч) 54 360 Дж (15,1 Вт·ч)
Шаг 1 с 3 600 57 600 Дж (16,0 Вт·ч) 543 600 Дж (151,0 Вт·ч)
Шаг 0,5 с 7 200 115 200 Дж (32,0 Вт·ч) 1 087 200 Дж (302,0 Вт·ч)

Это один из самых сильных аргументов против рассуждения большой языковой модели на каждое окно: рабочая нагрузка непрерывна, поэтому малые неэффективности на окно и обязательный проход валидатора умножаются 3 600 раз в час в базовом случае.

11.2 Длина контекста и утилизация

Препринт о топологии маршрутизации [12] утверждает, что токены на ватт могут резко варьировать с длиной контекста и что маршрутизация по длине контекста может быть мощнее обновлений оборудования, аналитически сообщая, что токены на ватт могут уполовиниться при удвоении контекста. Для этого анализатора следствия прямые: компактные структурированные подсказки обязательны для любого варианта на языковой модели; многословные объяснения на каждое окно должны быть вне горячего пути; длинный контекст истории пациента следует извлекать только во время аудита или рецензирования, если он клинически не требуется в шлюзе реального времени; и модель, которой нужна история сырой ЭКГ в контексте, энергетически не соответствует непрерывному прикроватному анализу.

11.3 PUE и место развёртывания

ЦОД-варианты должны умножать энергию информационных технологий на накладные расходы объекта, при этом серверы составляют около 60 процентов электроэнергии современного ЦОД в среднем, а охлаждение варьирует от уровней эффективного гиперскейла до гораздо более высоких корпоративных уровней [9][10]. Этот отчёт использует PUE = 1,56 как базовый множитель ЦОД, PUE = 1,2 как чувствительность для эффективного гиперскейла и без множителя ЦОД для прикроватных или встраиваемых краевых устройств, где следует использовать измеренную мощность из розетки. Это само по себе ось преимущества для компилируемого анализатора, развиваемая в разделе 12.

11.4 Антипаттерн токенизации сырой ЭКГ

Честная база даёт всем вариантам структурированные признаки. Если сырая ЭКГ токенизируется в текст, случаи языковых моделей становятся неконкурентными. Один пациенто-час имеет 21,6 млн сырых отсчётов; даже компактное текстовое представление вроде отведение=значение,время создало бы миллионы или десятки миллионов токенов на пациенто-час до какого-либо рассуждения модели, ухудшая длину контекста, давление кэша ключей и значений, размер трассы аудита и раскрытие защищаемой медицинской информации. Сырая ЭКГ относится к обработке сигнала и хранению доказательств; языковая модель, если используется вообще, должна потреблять компактные сводки признаков и безопасные ссылки.

12. Дополнительные структурные преимущества компилируемого анализатора

Помимо поокнной арифметики, несколько структурных свойств благоприятствуют компилируемому анализатору и не охватываются одними коэффициентами вывода.

Резидентная память и мощность простоя. Компилируемый пакет правил резидентен в килобайтах-мегабайтах, тогда как обслуживаемая языковая модель держит резидентно гигабайты-терабайты весов с соответствующей статической мощностью памяти, обновлением высокоскоростной памяти и потреблением ускорителя в простое даже между окнами. Для непрерывной, но низкочастотной рабочей нагрузки резидентная мощность простоя может доминировать в энергии языковой модели, тогда как у компилируемого анализатора почти нет резидентного следа.

Краевое развёртывание без ускорителя. Компилируемый анализатор работает на прикроватном или встраиваемом CPU без ускорителя и без накладных расходов объекта ЦОД, поэтому не применяются ни множитель PUE, ни сетевой обход. Облачно-обслуживаемая языковая модель добавляет энергию сетевого транспорта на каждое окно и множитель объекта на каждый джоуль. Для непрерывного потока этот член сети и накладных расходов оплачивается 3 600 раз в час.

Охлаждение и тепловое масштабирование. Энергия охлаждения масштабируется с мощностью устройства. Компилируемый анализатор при примерно 1 Вт в среднем налагает пренебрежимую тепловую нагрузку, тогда как ускорители в конверте 72700 Вт [7][8] несут накладные расходы охлаждения, которые множитель PUE лишь частично охватывает у постели.

Детерминизм устраняет множители выборки. Развёртывания языковых моделей, которым нужна более высокая надёжность, иногда используют стратегии выборки, такие как самосогласованность или ансамблирование, выполняющие вывод несколько раз на решение, умножая энергию. Компилируемый анализатор детерминирован: одна оценка даёт один пригодный к аудиту результат без множителя выборки.

Ограниченная задержка означает ограниченную устойчивую мощность. Компилируемый анализатор удовлетворяет задержке реального времени на низкой устойчивой частоте. Вариант на языковой модели должен уложиться в бюджет токенов в срок окна, что обычно требует более высокой устойчивой мощности и оставляет более тяжёлый энергетический хвост на длинных выводах.

13. Покритический анализ по вариантам

13.1 Большая языковая модель MoE

Сильные стороны: она может интегрировать разнородные сводки признаков и нарративный контекст; она может производить читаемые человеком объяснения для аудита или рецензирования; и маршрутизация активных параметров MoE может снизить вычисления декодирования относительно плотной модели сопоставимого общего числа параметров. Слабые стороны: высокая энергия выполнения для непрерывного вызова на уровне окна; длина контекста и поведение кэша ключей и значений могут доминировать в энергии; маршрутизация, размещение экспертов и перемещение памяти снижают видимую выгоду разреженных активных параметров; детерминированная трассируемость и ограниченный вывод требуют добавленного слоя валидатора; и владение полным предобучением энергетически велико и должно приводиться отдельно. Лучшая роль: не основной анализатор реального времени, а возможный офлайн-помощник рецензента, сводитель доказательств, объяснитель диагностической сортировки или копилот авторской разработки за детерминированным валидатором.

13.2 Малый анализатор на тщательно настроенной языковой модели

Сильные стороны: она может быть доменно-специализированной; она может быть эффективной на компактных входах и ограниченных выходах; она может поддерживать сортировку или объяснение там, где правила неполны; и она может работать на ускорителях меньшей мощности, чем фронтирные стеки обслуживания. Слабые стороны: она всё ещё дороже прямого исполнения правил для высокочастотных окон; она должна доказать, что её выход отображается в авторизованные термины и состояния кардио-флагов через слой валидатора; она может требовать частой повторной валидации после настройки или изменений подсказки; и она может незаметно деградировать, если подсказка, схема признаков или контекст отличаются от допущений обучения. Лучшая роль: ограниченный вторичный анализатор, генератор кандидатов для управляемого уточнения, помощь рецензенту для неоднозначных или неразрешённых окон и резерв только тогда, когда детерминированные правила явно отмечают неразрешённое состояние.

13.3 Компилируемый анализатор на основе правил на C++

Сильные стороны, изложенные на том же уровне количественной детализации, что и критика выше: форма работы соответствует форме задачи, поэтому специфичное для анализатора приращение составляет около 0,5 Вт (1 800 Дж/пациенто-час), половину его и так низкого итога 1 Вт, а остальное разделяется со всеми вариантами; энергия выполнения на один-два порядка ниже вариантов на языковых моделях в полной по шлюзу модели; детерминированное воспроизведение и аудит являются нативными, а не реконструируемыми, поэтому энергия аудита и повторной валидации ограничена; поведение с отказоустойчивым закрытием совместимо с управляемым клиническим программным обеспечением; резидентный след, мощность простоя, ускоритель, сеть и охлаждение близки к нулю у постели; и границы времени компиляции и времени выполнения согласуются с внутренними проектными нарративами. Слабые стороны: правила и исключения должны быть написаны, рецензированы и сопровождаемы; клиническое покрытие растёт только через управляемое семантическое уточнение; хрупкие или неполные наборы правил могут выдавать неподдерживаемые или неразрешённые исходы чаще, чем гибкая модель; и преимущество в энергии само по себе не доказывает клиническую достаточность. Лучшая роль: основной анализатор реального времени для ограниченных кардио-флагов и производства доказательств, авторитетный в паре с управляемой семантикой, доказательствами выпуска, детерминированным вычислительным ядром и замыканием диагностического контура.

14. Интерпретация

Отчёт не утверждает, что компилируемый код всегда лучше модели. Он говорит, что для этой конкретной рабочей нагрузки горячий путь узкий, непрерывный, привязанный к доказательствам и детерминированный, и такая форма благоприятствует компилируемым правилам и детерминированному вычислительному ядру. Рамка «интеллект на джоуль» [1] не переворачивает вывод: шлюз сопоставимости фиксирует единицу полезной работы как управляемую, привязанную к доказательствам находку, и вариант на языковой модели не может выдать эту единицу без детерминированного прохода валидатора, поэтому способность на джоуль для этой задачи равна или лучше на компилируемом пути.

Самые сильные применения языковой модели смежны с горячим путём: помощь авторской разработке прозы правил и тестовых сценариев; офлайн-кластеризация неразрешённых доказательств; рецензируемое объяснение по уже опубликованным доказательствам; генерация кандидатов для управляемых обновлений графа; и сведение отчётов аудита, где детерминированные факты остаются авторитетными. Самое слабое применение языковой модели — автономная интерпретация на каждое окно живого потока без детерминированного обоснования доказательствами; такая система может потреблять больше энергии и всё равно не пройти шлюз сопоставимости.

15. Практический план измерений

Следующим проектным шагом должен быть эмпирический измерительный стенд. Он должен задать корпус воспроизведения из синтетических и обезличенных окон 12-канальной ЭКГ, обновлений именованных терминов электролитов, ожидаемых поверхностей кардио-флагов и исключений и неподдерживаемых и неразрешённых случаев. Он должен реализовать измерительную обёртку, записывающую время по настенным часам, мощность пакета центрального процессора там, где доступно, мощность ускорителя там, где доступно, память процесса, записи в хранилище, сетевые байты и размер вывода доказательств. Он должен измерить четыре рабочие нагрузки: только общую подготовку сигнала; путь выполнения компилируемого варианта на основе правил; малую языковую модель по компактным признакам; и большую MoE по компактным признакам. Он должен прогнать три режима окна из раздела 4.2. Он должен сообщить джоули на окно, джоули на пациенто-час, ватт-часы на пациенто-час, байты доказательств на пациенто-час, энергию записи аудита там, где измерима, энергию прохода валидатора для вариантов на языковых моделях и результат прохождения или непрохождения шлюза функциональной сопоставимости.

Для тестов в ЦОД стенд должен следовать стандартизованной дисциплине измерения мощности [6]: измерять мощность системы внешним анализатором мощности или валидированной телеметрией, записывать периоды простоя и активности отдельно и сообщать утилизацию. Для краевых тестов он должен измерять мощность из розетки или на уровне плат, а не полагаться только на программные оценки.

16. Ограничения и отсутствия утверждений

Числа времени выполнения компилируемого анализатора являются модельными допущениями, а не измеренными проектными результатами, и намеренно помечены как таковые; разложение на общую подготовку и оценку правил также является модельным допущением. Числа времени выполнения языковых моделей сочетают литературные опорные точки и модельные допущения, и фактическая энергия обслуживания может существенно варьировать с оборудованием, батчингом, утилизацией, квантованием, длиной подсказки и длиной вывода. Коэффициенты прохода валидатора и повторяющейся повторной валидации — модельные допущения, введённые для отражения обязательств шлюза, которые литературные опорные точки не измеряют; они намеренно консервативны, но остаются уровнем D. Внешние исследования энергии вывода часто измеряют другие задачи, такие как классификация текста, ответы на вопросы, сведение или генерация изображений, и являются полезными опорными точками, а не прямыми измерениями анализа ЭКГ. Энергия обслуживания MoE особенно неопределённа, потому что число активных параметров — не единственный драйвер; маршрутизация, диспетчеризация, трафик памяти и утилизация важны, поэтому база трактуется как прокси генерации (раздел 9). Отчёт измеряет электроэнергию, а не углеродный след, водный след, стоимость, воплощённые выбросы оборудования или человеческий труд. Клиническое качество вне модели энергии: низкоэнергетический анализатор, не прошедший функциональный шлюз или клиническую валидацию, неприемлем.

17. Заключение

Для заданной задачи мгновенной оценки состояния здоровья энергооптимальное основное время выполнения — это компилируемый анализатор на основе правил на C++, опирающийся на авторизованную семантику, скомпилированный пакет, детерминированное исполнение вычислительным ядром, доказательства выполнения и пригодное к аудиту замыкание диагностики. Полная по шлюзу базовая амортизированная по жизненному циклу оценка — около 7 200 Дж/пациенто-час (2 Вт·ч/пациенто-час).

Малый анализатор на тщательно настроенной языковой модели — правдоподобная вспомогательная технология, особенно для сортировки, генерации кандидатов или ограниченной вторичной интерпретации, но её полная по шлюзу базовая амортизированная по жизненному циклу оценка — около 117 000 Дж/пациенто-час (32,5 Вт·ч/пациенто-час), примерно 16x компилируемой базы, когда учтены обязательный проход валидатора и повторяющаяся повторная валидация. Большая MoE — наименее энергетически соответствующая технология горячего пути; даже с компактными входами и без отнесения полного предобучения к основному сценарию её полная по шлюзу базовая амортизированная по жизненному циклу оценка — около 768 600 Дж/пациенто-час (213,5 Вт·ч/пациенто-час), примерно 107x компилируемой базы.

Практическая рекомендация поэтому гибридна, но асимметрична: держать анализатор реального времени детерминированным и компилируемым, а языковые модели использовать вне жёсткого контура реального времени для поддержки авторской разработки, сведения доказательств, помощи рецензенту и кандидатов на управляемое уточнение.

Авторская основа

Статья опирается на внутреннюю документацию проекта HealthOS: спецификации, схемы и реестры, задающие авторизованную семантику и её скомпилированную форму, на среду выполнения и инструменты, дающие доказательства выполнения, и на смежные статьи серии, объединённые общим каноном терминологии. В частности, она опирается на смежную рукопись об интерпретации ЭКГ для модели именованных терминов и кардио-флагов, на смежную рукопись о потоковом анализаторе для окон и потоковых доказательств, на смежную рукопись об анализаторе на основе правил без сохранения состояния для хоста сервиса в пределах запроса и вызова вычислительного ядра и на смежную рукопись о вычислительном ядре и ядре безопасности для детерминированного исполнения и разделения долговечного аудита и трассы отладки. Это рабочие источники, которые обосновывают инженерные решения и удерживают единство терминологии в серии. Они остаются внутренней авторской основой, а не публичными ссылками, и не приводятся как ссылки на репозиторий в тексте.

Конфликт интересов

Рукопись описывает реализацию определенного аспекта платформы HealthOS, а именно: сравнительную энергию времени выполнения и жизненного цикла компилируемого анализатора на основе правил и анализаторов на языковых моделях для мгновенной оценки состояния здоровья.

Финансирование

Финансирование работ со стороны РТЛАБ.

Литература

  1. Chen D. et al. AI+HW 2035: Shaping the Next Decade. arXiv:2603.05225, 2026. https://arxiv.org/abs/2603.05225
  2. Luccioni A.S., Jernite Y., Strubell E. Power Hungry Processing: Watts Driving the Cost of AI Deployment? ACM FAccT 2024. https://facctconference.org/static/papers24/facct24-6.pdf
  3. Luccioni A.S., Viguier S., Ligozat A.L. Estimating the Carbon Footprint of BLOOM, a 176B Parameter Language Model. JMLR 24(253), 2023. https://www.jmlr.org/papers/v24/23-0069.html
  4. MLCommons. Llama 2 70B: An MLPerf Inference Benchmark for Large Language Models, 2024. https://mlcommons.org/2024/03/mlperf-llama2-70b/
  5. MLCommons. MLPerf Inference Results v5.0. https://docs.mlcommons.org/inference_results_v5.0/
  6. MLCommons. Power Measurement - MLPerf Inference Documentation. https://docs.mlcommons.org/inference/power/
  7. NVIDIA. H100 Tensor Core GPU. https://www.nvidia.com/en-us/data-center/h100/
  8. NVIDIA. L4 Tensor Core GPU. https://www.nvidia.com/en-us/data-center/l4/
  9. IEA. Energy demand from AI, 2025. https://www.iea.org/reports/energy-and-ai/energy-demand-from-ai
  10. Uptime Institute. Global Data Center Survey 2024. https://intelligence.uptimeinstitute.com/resource/uptime-institute-global-data-center-survey-2024
  11. Liu X. et al. Position: LLM Inference Should Be Evaluated as Energy-to-Token Production. arXiv:2605.11733, 2026. Препринт. https://arxiv.org/abs/2605.11733
  12. Chen H. et al. The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency. arXiv:2603.17280, 2026. Препринт. https://arxiv.org/abs/2603.17280
  13. Chung J.W. et al. Where Do the Joules Go? Diagnosing Inference Energy Consumption. arXiv:2601.22076, 2026. Препринт. https://arxiv.org/abs/2601.22076