Итоговый справочно-обобщающий конспект: Архитектурная карта курса

Генеральная архитектурная карта дисциплины «ОП.02 Архитектура аппаратных средств», фундаментальные законы и балансы вычислительных систем, открытые критерии дифференцированного зачета.

1. Генеральная архитектурная карта курса ОП.02 (от кремния до дата-центров)

Архитектура аппаратных средств представляет собой многоуровневую иерархию абстракций, связывающую фундаментальные физические процессы полупроводников с логикой высокопроизводительных вычислительных комплексов.

Уровень иерархии Элементная база и узлы Ключевые принципы и физические законы Критический архитектурный компромисс
1. Физика полупроводников и логика Полевые транзисторы (FinFET, GAAFET), вентили NOT, AND, OR, XOR, комбинационные сумматоры, D-триггеры. Закон Мура (удвоение транзисторов), физические ограничения фотолитографии, паразитные токи утечки p-n переходов. Энергопотребление vs Скорость: уменьшение узла литографии (3 нм/2 нм) снижает динамическую мощность, но взвинчивает токи утечки подзатворной изоляции.
2. Микроархитектура процессора (CPU/NPU) АЛУ, конвейер (Fetch-Decode-Execute-Mem-WB), блоки предсказания ветвлений (Branch Target Buffer), файл регистров, кэш L1/L2/L3. Суперскалярность, внеочередное исполнение (Out-of-Order / RoB), переименование регистров, векторные инструкции SIMD (AVX-512, NEON, SVE). Ширина конвейера vs Спекуляция: глубокий конвейер поднимает тактовую частоту, но плата за ошибку спекулятивного исполнения растет пропорционально глубине каскадов (15–20 тактов штрафа).
3. Иерархия запоминающих устройств Регистры (0.5 нс) $\to$ L1 (1 нс) $\to$ L2 (3–4 нс) $\to$ L3 (10–12 нс) $\to$ DRAM DDR5 (60–80 нс) $\to$ NVMe SSD (10–20 мкс) $\to$ HDD / Tape (мс). Принцип пространственной и временной локальности данных, теги кэш-строк (64 байта), протоколы когерентности MESI/MOESI. Memory Wall: тактовая частота процессорных ядер выросла в сотни раз, а латентность случайного доступа к DRAM (tRCD, tCL) за 20 лет практически не изменилась (оставаясь в районе 12–15 нс).
4. Системные шины и интерконнекты Магистрали PCIe 4.0/5.0/6.0, протокол CXL (Compute Express Link), межсокетные линки Intel UPI, AMD Infinity Fabric, NVIDIA NVLink. Дифференциальная передача сигналов, кодирование 128b/130b и PAM4, протоколы когерентного разделения общей памяти хоста и ускорителей. Пакетный оверхед vs Задержка сериализации: переход на высокоскоростные последовательные шины устранил перекос фаз параллельных шин, но добавил задержку кодеров/сериализаторов (SerDes).
5. Периферия, шлюзы и кластеры Сетевые адаптеры RDMA (InfiniBand/RoCE), NVMe-oF, USB4/Thunderbolt 4, промышленные полевые шины RS-485 Modbus, CAN FD. Прямой доступ к памяти (DMA / GPUDirect RDMA), аппаратная гальваническая развязка, детерминизм реального времени. Универсальность vs Детерминизм: ОС общего назначения (Linux) эффективна для облаков, но не гарантирует жестких микросекундных таймингов без RT-ядер и аппаратной изоляции.

2. Фундаментальные системные балансы и законы архитектуры

2.1. Закон Амдала (Предел параллельного ускорения)

Закон определяет теоретическое максимальное ускорение системы при параллельном масштабировании вычислительных узлов:

S(N) = 1 / [ (1 - P) + (P / N) ]

Где P — доля вычислительной задачи, поддающаяся параллельной обработке, а N — количество параллельных исполнительных ядер/процессоров. Если даже 5% задачи выполняется строго последовательно ($P = 0.95$), то даже на бесконечном числе ядер ускорение физически не сможет превысить:

S(∞) = 1 / (1 - 0.95) = 20 крат

Инженерный вывод: Наращивание процессорных ядер бесполезно без ликвидации узких мест синхронизации, барьеров памяти и последовательных участков программного кода.

2.2. Нарушение масштабирования Деннарда и «Темный кремний» (Dark Silicon)

Роберт Деннард в 1974 году сформулировал закон: при уменьшении физических размеров транзистора плотность энергопотребления кристалла остается постоянной, так как напряжение питания ($V$) и емкость ($C$) пропорционально снижаются:

P = C × V² × f + I_leakage × V

Около 2005 года предел Деннарда был исчерпан: снижение напряжения питания ниже ~0.7–0.8 В стало невозможным из-за резкого роста подпороговых токов утечки и нестабильности логических переходов. Это привело к «тепловому барьеру» (Thermal Wall) тактовых частот процессоров (плато около 3.5–5.5 ГГц). В современных многоядерных чипах возникает феномен «темного кремния»: процессор физически не может активировать 100% своих транзисторов на максимальной частоте одновременно, не расплавив кремниевую пластину, что требует сложного динамического троттлинга (AVX offset, TDP/PL2 limits).

2.3. Проблема «стены памяти» (Memory Wall)

За последние десятилетия производительность исполнительных блоков процессоров росла со скоростью ~50% в год, в то время как время цикла доступа к DRAM сокращалось лишь на ~7% в год. Возник гигантский разрыв, из-за которого мощные суперскалярные конвейеры простаивают сотни тактов в ожидании данных из оперативной памяти.

Архитектурные методы преодоления Memory Wall:

2.4. Экономика совокупной стоимости владения (TCO: CapEx vs OpEx)

Архитектурное проектирование ЭВМ всегда базируется на расчете TCO = CapEx + OpEx:

Серверная стойка мощностью 30 кВт за 3 года круглосуточной эксплуатации в ЦОД с PUE = 1.3 потребляет электроэнергии на сумму, часто превышающую первоначальную стоимость самих серверов. Энергоэффективность платформы (Performance per Watt) — ключевой критерий архитектурного выбора.

3. Инженерные формулы и расчетные соотношения

3.1. Пропускная способность оперативной памяти (DDR5 / LPDDR5X)

BW_total = N_channels × (MT/s × 8 байт) × η_controller

Где N_channels — число каналов контроллера, MT/s — эффективная частота передач, 8 байт — ширина канала (64 бита), η — практический КПД контроллера (~0.80–0.85).

3.2. Пропускная способность системной шины PCIe

BW_PCIe = N_lanes × Rate_GTs × (Data_bits / Total_bits) / 8

Для PCIe 4.0: $16\text{ GT/s} \times (128/130) / 8 \approx 1.969\text{ ГБ/с}$ на линию (x16 $\approx 31.5\text{ ГБ/с}$).
Для PCIe 5.0: $32\text{ GT/s} \times (128/130) / 8 \approx 3.938\text{ ГБ/с}$ на линию (x16 $\approx 63.0\text{ ГБ/с}$).

3.3. Надежность системы: модель последовательного соединения (MTBF)

λ_system = ∑ λ_i  (FIT = 1 отказ / 10&sup9; часов),   MTBF = 1 / λ_system

4. Открытые правила и критерии проведения дифференцированного зачета

Дифференцированный зачет принимается по результатам защиты одного из 4 комплексных проектов в аттестационном листе zanyatie.html:

Шкала оценивания: