Архитектура аппаратных средств представляет собой многоуровневую иерархию абстракций, связывающую фундаментальные физические процессы полупроводников с логикой высокопроизводительных вычислительных комплексов.
| Уровень иерархии | Элементная база и узлы | Ключевые принципы и физические законы | Критический архитектурный компромисс |
|---|---|---|---|
| 1. Физика полупроводников и логика | Полевые транзисторы (FinFET, GAAFET), вентили NOT, AND, OR, XOR, комбинационные сумматоры, D-триггеры. | Закон Мура (удвоение транзисторов), физические ограничения фотолитографии, паразитные токи утечки p-n переходов. | Энергопотребление vs Скорость: уменьшение узла литографии (3 нм/2 нм) снижает динамическую мощность, но взвинчивает токи утечки подзатворной изоляции. |
| 2. Микроархитектура процессора (CPU/NPU) | АЛУ, конвейер (Fetch-Decode-Execute-Mem-WB), блоки предсказания ветвлений (Branch Target Buffer), файл регистров, кэш L1/L2/L3. | Суперскалярность, внеочередное исполнение (Out-of-Order / RoB), переименование регистров, векторные инструкции SIMD (AVX-512, NEON, SVE). | Ширина конвейера vs Спекуляция: глубокий конвейер поднимает тактовую частоту, но плата за ошибку спекулятивного исполнения растет пропорционально глубине каскадов (15–20 тактов штрафа). |
| 3. Иерархия запоминающих устройств | Регистры (0.5 нс) $\to$ L1 (1 нс) $\to$ L2 (3–4 нс) $\to$ L3 (10–12 нс) $\to$ DRAM DDR5 (60–80 нс) $\to$ NVMe SSD (10–20 мкс) $\to$ HDD / Tape (мс). | Принцип пространственной и временной локальности данных, теги кэш-строк (64 байта), протоколы когерентности MESI/MOESI. | Memory Wall: тактовая частота процессорных ядер выросла в сотни раз, а латентность случайного доступа к DRAM (tRCD, tCL) за 20 лет практически не изменилась (оставаясь в районе 12–15 нс). |
| 4. Системные шины и интерконнекты | Магистрали PCIe 4.0/5.0/6.0, протокол CXL (Compute Express Link), межсокетные линки Intel UPI, AMD Infinity Fabric, NVIDIA NVLink. | Дифференциальная передача сигналов, кодирование 128b/130b и PAM4, протоколы когерентного разделения общей памяти хоста и ускорителей. | Пакетный оверхед vs Задержка сериализации: переход на высокоскоростные последовательные шины устранил перекос фаз параллельных шин, но добавил задержку кодеров/сериализаторов (SerDes). |
| 5. Периферия, шлюзы и кластеры | Сетевые адаптеры RDMA (InfiniBand/RoCE), NVMe-oF, USB4/Thunderbolt 4, промышленные полевые шины RS-485 Modbus, CAN FD. | Прямой доступ к памяти (DMA / GPUDirect RDMA), аппаратная гальваническая развязка, детерминизм реального времени. | Универсальность vs Детерминизм: ОС общего назначения (Linux) эффективна для облаков, но не гарантирует жестких микросекундных таймингов без RT-ядер и аппаратной изоляции. |
Закон определяет теоретическое максимальное ускорение системы при параллельном масштабировании вычислительных узлов:
Где P — доля вычислительной задачи, поддающаяся параллельной обработке, а N — количество параллельных исполнительных ядер/процессоров. Если даже 5% задачи выполняется строго последовательно ($P = 0.95$), то даже на бесконечном числе ядер ускорение физически не сможет превысить:
Инженерный вывод: Наращивание процессорных ядер бесполезно без ликвидации узких мест синхронизации, барьеров памяти и последовательных участков программного кода.
Роберт Деннард в 1974 году сформулировал закон: при уменьшении физических размеров транзистора плотность энергопотребления кристалла остается постоянной, так как напряжение питания ($V$) и емкость ($C$) пропорционально снижаются:
Около 2005 года предел Деннарда был исчерпан: снижение напряжения питания ниже ~0.7–0.8 В стало невозможным из-за резкого роста подпороговых токов утечки и нестабильности логических переходов. Это привело к «тепловому барьеру» (Thermal Wall) тактовых частот процессоров (плато около 3.5–5.5 ГГц). В современных многоядерных чипах возникает феномен «темного кремния»: процессор физически не может активировать 100% своих транзисторов на максимальной частоте одновременно, не расплавив кремниевую пластину, что требует сложного динамического троттлинга (AVX offset, TDP/PL2 limits).
За последние десятилетия производительность исполнительных блоков процессоров росла со скоростью ~50% в год, в то время как время цикла доступа к DRAM сокращалось лишь на ~7% в год. Возник гигантский разрыв, из-за которого мощные суперскалярные конвейеры простаивают сотни тактов в ожидании данных из оперативной памяти.
Архитектурные методы преодоления Memory Wall:
Архитектурное проектирование ЭВМ всегда базируется на расчете TCO = CapEx + OpEx:
Где N_channels — число каналов контроллера, MT/s — эффективная частота передач, 8 байт — ширина канала (64 бита), η — практический КПД контроллера (~0.80–0.85).
Для PCIe 4.0: $16\text{ GT/s} \times (128/130) / 8 \approx 1.969\text{ ГБ/с}$ на линию (x16 $\approx 31.5\text{ ГБ/с}$).
Для PCIe 5.0: $32\text{ GT/s} \times (128/130) / 8 \approx 3.938\text{ ГБ/с}$ на линию (x16 $\approx 63.0\text{ ГБ/с}$).
Дифференцированный зачет принимается по результатам защиты одного из 4 комплексных проектов в аттестационном листе zanyatie.html:
Шкала оценивания:
domashnee_zadanie.html.