Выбор CPU/SoC, топология шин PCIe/NVLink/CXL, адресация и балансировка NUMA, учет законов Амдала и предела Деннарда.
Пропускная способность памяти (DDR5/HBM) и шин (PCIe 5.0 128b/130b), расчет мощности, токов питания и надежности MTBF.
Локализация скрытой аппаратной неисправности (VRM, броски токов, земляные петли), физическое обоснование и план устранения.
Где P — доля параллельного кода, N — число ядер.
Если последовательная часть $1 - P = 5\%$, даже при бесконечном $N$ ускорение системы не превысит 20x.
До 2005 г. уменьшение транзистора позволяло снижать напряжение $V$. Сегодня порог ~0.7 В уперся в квантовые токи утечки $I_{leak}$.
Результат: плато тактовых частот (3.5–5.5 ГГц) и барьер рассеивания тепла.
Скорость АЛУ росла на ~50% в год, а задержка доступа к DRAM сокращалась лишь на ~7% в год. Доступ к RAM требует 150–250 процессорных тактов простоя.
Конвейер современного CPU 70% времени простаивает на промахах кэша (Cache Misses).
За 3 года непрерывной эксплуатации стойка AI-серверов мощностью 30 кВт в дата-центре с коэффициентом PUE 1.3 потребляет электроэнергии на сумму, превышающую стоимость серверного оборудования!
Ключевая метрика: Производительность на Ватт (Perf / Watt).
Для 2-сокетного сервера (24 канала DDR5-4800):
С учетом КПД шины (~85%): ~783 ГБ/с чистой полосы.
Слот PCIe 5.0 x16 обеспечивает ~63.0 ГБ/с в одном направлении (дуплекс 126 ГБ/с).
Кодирование 128b/130b снижает накладные расходы до 1.54% (против 20% в PCIe 2.0 8b/10b).
Симптом: Спонтанный ребут под 100% нагрузкой СУБД при температуре CPU 68°C.
Причина: Радиаторы VRM в тени высоких радиаторов CPU, перегрев ключей DrMOS выше 115°C (OTP).
Решение: Установка дефлекторов (Air Shrouds), оптимизация кривой вентиляторов BMC.
Симптом: Аварийное отключение БП при переходе от прямого к обратному проходу модели.
Причина: Микросекундный бросок мощности ускорителей до 3400 Вт, срабатывание защиты OCP в схеме БП 1+1.
Решение: Режим распределения токов 2+0, БП с transient tolerance 140%.
Симптом: Сброс частоты CPU до 800 МГц при температуре кристаллов 72°C.
Причина: Перегрев фаз питания GPU (125°C) из-за некондиционной толстой термопрокладки (1.5 мм вместо 0.5 мм).
Решение: Замена термоинтерфейса, калибровка карты триггеров датчиков платы.
Симптом: Выгорание портов RS-485 и Kernel Panic при пуске высоковольтного двигателя.
Причина: Экран кабеля заземлен с двух сторон; дешевые изоляторы без изолированного DC-DC питания.
Решение: Заземление строго в 1 точке, микросхемы с изоляцией до 3 кВ (ADuM5401), TVS-супрессоры.
localStorage.data:image/jpeg;base64,...) без внешних сетевых запросов.