Полный текст
SETUN II* — троичный AI-процессор, который уже считает на "кремнии*"Что это вообще*Название будет сменяться, наследию деваться некудаГибрид «CPU + AI-ускоритель» на балансной троичной арифметике. Веса нейросети хранятся не как длинные цепочки из 0 и 1, а как три состояния: −1, 0, +1.И тут вся соль. Умножение на таком весе вырождается:× (−1) → вычесть× 0 → пропустить (а это ~31% всех весов!)× (+1) → прибавитьПолноценный умножитель не нужен вообще — остаётся только сложение, вычитание или пропуск. А множитель — самая дорогая часть MAC-блока, почти половина его площади (47% площади вычислительной полосы в нашем синтезе). Мы меняем его на «знак + сумматор». Плюс каждый третий вес — ноль, его можно не считать вовсе. Даровая экономия энергии на каждой операции."Потомок" советской «Сетуни» (МГУ, 1958) — первого в мире серийного троичного компьютера. Только теперь сегодня на вдохновении это AI-ускоритель, и синтезируется он на стандартных CMOS-ячейках. Цель — Микрон 180 нм. Узел, который Россия контролирует уже сейчас.Главное: ядро РАБОТАЕТ на FPGAНе симуляция. Не картинка. Процессор (управляющее ядро + троичная ткань + демон) исполнил программу на живом FPGA — GW5AST-138, Tang Mega 138K. Всё прочитано по JTAG, цифры считаны прямо с кремния:✅ базовый matmul на кремнии — C=[[7,10],[19,22]], сошлось бит-в-бит✅ 1091 такт матмула, точно совпало с gate-симуляцией✅ демон принял 86% выходов на РЕАЛЬНОМ слое nanoGPTСамый рискованный шаг — заставить кремний считать троичную математику — уже пройден.Троичный GPT реально пишет текстНаш nanoGPT: 4.9 млн параметров, 97% весов троичные, обучен на Шекспире. Генерирует связный текст — с именами персонажей, репликами, пунктуацией. Все его матмулы — это ровно операция нашей ткани (add/sub/skip).И вот что важно — троичная модель обобщает лучше полноточной:ТроичныйGPT 4.9M val loss 1.55 1.49 МБfp-бейзлайн 10.8M val loss 1.77 21.6 МБВдвое меньше параметров, в 14 раз меньше памяти — и качество выше. Упрощение до −1/0/+1 работает как встроенная регуляризация: модель хуже «зубрит» и лучше работает на новом.Демон — спекулятивное умножениеАппаратный механизм, который предсказывает результат и проверяет догадку «забором» (fence) с гарантией: итоговая ошибка всегда ≤ порога ε. Угадал — пропустили пересчёт. Не угадал — посчитали честно. Скорость без потери точности.На реальных весах: ε 5% → принято 47% (×1.9) ε 10% → принято 76% (×4.0) ε 20% → принято 95% (×16)MNIST на нашем RTL-движкеСамую изученную сеть в мире обучили в троичном виде и прогнали потактово на нашем железе:✅ 97.3% точности (fp-бейзлайн 98.0% — разрыв всего 0.7%) ✅ 8/8 тест-цифр классифицировано верно ✅ 16× меньше памяти весов: 49.6 КБ против 794 КБЭнергия — где троичность рвёт всехЭнергия на одну операцию (MAC):CPU AMD Zen fp32 — 650–1250 пДжНаша ткань @180нм — 25–55 пДжA100 bf16 @7нм — 3.1 пДжНаша ткань на изо-узле 7нм — ~0.3 пДжУже на 200-180-нм заводе мы экономичнее серверного CPU в разы. Перенеси тот же дизайн на 7 нм — и по энергии на операцию обгоняем A100 примерно в 10 раз. (влажные цифровые мечты - прим. ред.) Выигрыш чисто архитектурный (нет умножителя + 2-битные операнды), он переезжает вместе с техпроцессом.Архитектура — растёт как LEGOКристалл собран из одинаковых тайлов (как у Tenstorrent). Нужно мощнее — добавляешь тайлы, ничего не переписывая. При росте сетки в 4 раза частота держится 77→70 МГц — почти не падает. Один дизайн масштабируется от датчика в часах до стойки в дата-центре.Где мы сейчасСамое страшное позади: кремний считает троичную математику, демон ускоряет, модель пишет текст. Дальше — сообщу.Поддержать канал:🦆🦆🦆Поддержать канал: ТБАНКПоддержать канал: ЮМАНИПоддержать канал: PAYPAL paperfunkrecordings@gmail.comПоддержать канал: USDT(trc20) TTk8CqGF9dd4avQcSPDwDF5z3jMcCxGqqTПоддержать канал: BITCOIN