Нейроморфный глаз

НЕЙРОМОРФНЫЕ ФОТОДИОДНЫЕ МАТРИЦЫ USTC
Тема: Сенсор в одном диоде для робототехники и In-Sensor Computing

СЕРГЕЙ:
сегодня прочитал одну интересную новость.
вот текст отрывок из этой новости

Сенсор в одном диоде для роботов: Китайские ученые создали фотодиод, который сам снимает, обрабатывает и запоминает изображения без внешних чипов. Благодаря этому роботы смогут "видеть" в разы быстрее и экономнее.

Расскажи об этой новости подробнее и что это дает для робототехники.

GEMINI:
Сергей, речь идет о прорывном исследовании ученых из Китайской академии наук (USTC), опубликованном в журнале Nature Electronics. Им удалось решить одну из главных проблем современной микроэлектроники — избавиться от «узкого горлышка фон Неймана», из-за которого данные постоянно гоняются между камерой, памятью и процессором.

В чем суть технологии:
Ученые создали мультифункциональный p-n фотодиод на основе вертикальных нитевидных нанокристаллов (p-GaN/n-AlGaN/n-GaN). Благодаря встроенному «резервуару электронов» внутри самого полупроводника, один и тот же фотодиод умеет выполнять три задачи:
- Фиксировать свет (функция обычной камеры).
- Запоминать сигнал (оптическая память).
- Обрабатывать данные (работает как нейрон нейросети, фильтрует шумы и распознает объекты).

Переключение между режимами происходит мгновенно — простым изменением подаваемого напряжения (bias voltage) без привлечения сторонних микросхем.

Что это дает для робототехники:
Обычный робот тратит до 80% времени и энергии не на принятие решений, а на банальную прокачку гигабайтов сырого видеопотока от сенсора к процессору. Новая технология меняет саму архитектуру зрения:
- Молниеносная реакция (Zero Latency): Вычисления происходят прямо в месте попадания света на матрицу (In-Sensor Computing). Робот не ждет, пока кадр передастся в центральный процессор, обработается и вернется обратно. Это критично для автономных дронов, манипуляторов и автопилотов при избегании столкновений.
- Колоссальная энергоэффективность: Из цепи исключаются шины передачи данных, внешние модули RAM и вычислительные чипы. Энергопотребление системы зрения снижается в десятки раз, что увеличивает время автономной работы мобильных роботов.
- Миниатюризация и снижение веса: Вместо сложного «бутерброда» из матрицы, микроконтроллера и обвязки транзисторов используется чистый массив диодов. Это позволяет ставить полноценное нейроморфное зрение на крошечные микророботы или пальцы робо-манипуляторов.
- Аппаратное очищение от шумов: Матрица сама, на физическом уровне, отсеивает визуальные помехи и блики еще до того, как сформируется итоговое изображение.

СЕРГЕЙ:
Ну всё равно же распознанное изображение должно же как-то с чем-то сравниваться, которое есть где-то в базовой памяти или в каком-то процессоре хранится.

GEMINI:
Сергей, абсолютно логичный вопрос! И здесь кроется самый интересный нюанс нейроморфных сенсоров.

Суть в том, что этому диоду не нужно отправлять изображение на центральный процессор для сравнения с базой данных. Сравнение и хранение эталонов происходит прямо внутри самого диода.

Как это работает без внешнего процессора:
В традиционных системах память и процессор разделены. В этом китайском диоде реализована так называемая память мемристорного типа (или In-Sensor Computing).
- Эталоны хранятся в физике полупроводника: Образы или шаблоны (например, форма препятствия, контур детали, движение) «записываются» прямо в физическое состояние диода. Это делается путем изменения проводимости полупроводниковых нанокристаллов с помощью электрических импульсов.
- Матрица — это и есть база данных: Каждому пикселю или группе диодов перед работой задаются определенные весовые коэффициенты (синаптические веса), прямо как в нейросети. Вся «базовая память» — это буквально матрица проводимостей самих диодов.

Как происходит процесс «сравнения»:
Когда свет падает на фотодиод, происходит не просто снятие кадра, а сразу математическая операция:
1. Мгновенное перемножение: Входной свет генерирует ток, который умножается на внутреннюю проводимость диода (которая и есть сохраненный эталон).
2. Физическое сравнение: Если пришедший свет совпадает с сохраненным в структуре диода образом, диод выдает определенный электрический сигнал (например, пик тока). Если не совпадает — сигнала нет.
3. Результат на выходе: На центральный процессор робота отправляется не сам тяжелый кадр, а готовенький логический ответ: «Объект найден» или «Препятствие прямо по курсу».

Главный итог:
Центральный процессор робота, конечно, никуда не исчезает — он всё еще нужен для глобального управления (куда ехать, какую задачу выполнять).

Но вместо того чтобы загружать гигабайтами видеокадров и «мозгами» сравнивать каждый пиксель, процессор получает от диодного сенсора уже готовый короткий сигнал-вывод. Сенсор сам взял на себя 99% рутинной работы по распознаванию и сравнению.

СЕРГЕЙ:
И на сегодняшний день сколько объектов можно интегрировать в память этого видеоглаза?

GEMINI:
Сергей, если говорить о физических цифрах именно этого конкретного прототипа, то на данный момент его память измеряется не сотнями гигабайт, а градациями состояний и масштабом матрицы.

1. Емкость одного диода (8 дискретных состояний):
В режиме photomemory один диод способен устойчиво сохранять до 8 линейных уровней проводимости (состояний тока).
В цифровом эквиваленте это означает, что один диод хранит 3 бита информации. То есть он запоминает не просто «был свет / не было света», а 8 градиентов яркости или весовых коэффициентов.

2. Сколько «объектов» можно записать в матрицу:
В своей работе ученые из USTC продемонстрировали работу нейроморфного прототипа на тестовой матрице 10 * 10 диодов (100 пикселей):
- В физическом представлении: В такую матрицу загружаются шаблоны базовых визуальных элементов (например, базовые цифры, геометрические фигуры, контуры или 10 основных типов препятствий/знаков).
- Точность распознавания: На таком масштабе встроенная в матрицу аппаратная нейросеть показала точность классификации более 95% (для сравнения, без встроенной очистки от шума точность составляла менее 60%).

Каков предел этой технологии?
Естественно, матрица 10 * 10 — это лишь лабораторный proof-of-concept (доказательство концепции). Главный плюс разработки — её совместимость с кремниевым производством (CMOS).
- Как это масштабируется: Количество программируемых «объектов» или классов распознавания зависит не от объёма флеш-памяти, а от количества диодов в массиве (разрешения матрицы).
- Перспектива: При переносе этой структуры на полноценную матрицу (например, 1000 * 1000 диодов) такая «сетчатка» сможет одновременно удерживать в своей физической структуре сложную нейросеть с миллионами синаптических весов. Это позволит классифицировать тысячи сложных объектов (людей, машины, дорожные знаки, специфические детали на конвейере) без единого обращения к внешнему процессору.

СЕРГЕЙ:
К нему же, наверное, будет и обратная какая-то, ну, стандартная матрица прикрепляться, чтобы неизвестные объекты дописывались как-то, или дописывать невозможно?

GEMINI:
Сергей, ты попал в самое яблоко! Перезаписывать данные можно, но делает это не параллельная классическая матрица, а сам же этот фотодиодный массив.

Технология позволяет как динамически менять «память» прямо в тех же диодах, так и сочетать ее с обычными системами.

1. Можно ли «дописывать» новые объекты?
Да, можно, и внешняя матрица для этого не нужна.
Память этих диодов не «запекается» на заводе намертво. Встроенный электронный резервуар управляем:
- Запись и перезапись: Чтобы «обучить» диод новому объекту или записать новый весовой коэффициент, на него подается короткий электрический импульс напряжения (bias voltage). Заряды затекают в нанокристаллы и изменяют их проводимость.
- Стирание: Импульс другой полярности полностью «очищает» диод или сбрасывает его в исходное состояние.

То есть матрица гибридная: она может работать в режиме считывания (распознавания) и в режиме записи (обучения новым образцам).

2. Как решается проблема «неизвестных объектов» на практике:
Здесь как раз и применяется гибридный подход, о котором ты подумал:
1. Знакомый объект: Фотодиодный глаз видит объект (например, «человек» или «ящик»). Диод мгновенно выдает совпадение, и главный процессор робота даже не просыпается для анализа пикселей.
2. Неизвестный объект (аномалия): Диод реагирует на свет, но ни один из сохраненных паттернов не совпадает. Диод выдает сигнал: «Неизвестный сигнал!».
3. Дообучение: В этот момент робот может через обычный канал сфотографировать объект, отправляет его на центральный процессор (или в облако), где нейросеть понимает: «Ага, это новый тип препятствия».
4. Обновление памяти: Центральный процессор отправляет короткую команду-импульс обратно на матрицу фотодиодов и перезаписывает веса прямо в этих диодах. Теперь сенсор «знает» и этот объект тоже.

Главный плюс такой гибридности:
Роботу не нужно постоянно держать под рукой огромную гигабайтную базу. В диодную «сетчатку» загружаются только самые частые и критически важные объекты для конкретной задачи (например, для робота-пылесоса — это тапочки, провода и стены).

Если он встречает что-то абсолютно новое, он один раз подключает «большие мозги», перезаписывает физическое состояние диодов — и дальше снова работает на сверхскоростях без участия процессора.

СЕРГЕЙ:
Возникает интересный вопрос: а насколько быстро будут развиваться эти технологии и какого размера приблизительно понадобится матрица, чтобы хранить где-то до миллиона объектов и вплоть до того, чтобы даже распознавать лица людей?

GEMINI:
Сергей, здесь кроются два очень интересных момента: физика абстрагирования данных (векторные эмбеддинги) и реальные сроки выхода технологии в массовое производство.

Сколько диодов нужно для 1 миллиона объектов?
Чтобы хранить миллион объектов или распознавать лица, не нужно делать матрицу на миллион диодов. В современное нейроморфное зрение не запекают миллион отдельных «фотографий».

Нейросети работают через векторные описания (эмбеддинги):
1. Любое человеческое лицо или объект сводятся к математическому вектору (набору из 128, 256 или 512 числовых параметров — расстояния между глазами, углами челюсти, градиенты светотени).
2. Чтобы в матрице разместить модель, способную выделять эти параметры и сравнивать их с базой, размер самого фотодиодного массива должен быть порядка от 2 до 8 мегапикселей (Full HD или 4K).

- Размер кристалла: При текущей CMOS-технологии изготовления нанокристалла (p-GaN/n-AlGaN/n-GaN) матрица на 2–5 мегапикселей займет всего около 5 * 5 миллиметров — размер обычной селфи-камеры смартфона.
- Как поместится миллион объектов: В самой «диодной сетчатке» хранится не сама база миллиона людей, а сверхбыстрый сверточный фильтр (экстрактор фич). Она на лету за доли микросекунд превращает лицо человека в компактный цифровой «векторный отпечаток». Этот отпечаток затем за 1 такт сверяется с хэш-таблицей в компактном модуле памяти, что занимает мгновения.

Насколько быстро технология войдет в реальную жизнь?
Прогресс в этой области идет по классическому треку полупроводниковой индустрии:
1. Лабораторные прототипы: Матрицы 10 * 10 и 64 * 64 пикселей (доказательство работы мультифункциональных диодов).
2. Ближайшие 3–5 лет (Индустриальный этап): Выход первых специализированных чипов низкого разрешения (например, сенсоры 320 * 240 пикселей). Они будут использоваться в узких задачах: датчики движения для промышленных роботов, слежение за взглядом в VR-гарнитурах, автономные квадрокоптеры.
3. Через 7–10 лет (Массовый рынок): Появление полноценных мегапиксельных «нейроморфных сетчаток», совмещенных с интерфейсом человеческого лица и динамических сцен.

Главный плюс этой китайской разработки из USTC в том, что она создана на основе нитрида галлия (GaN) на кремниевой подложке. Это значит, что для ее производства не нужно строить новые фабрики — ее можно штамповать на уже существующих линиях по производству обычных кремниевых микросхем.

СЕРГЕЙ:
А если создать, к примеру, матрицу на 200 мегапикселей, сколько по твоим подсчётам она сможет вместить данных?

GEMINI:
Сергей, давай посчитаем! Это интересная математическая задачка.

Чтобы узнать емкость такой матрицы, нужно отталкиваться от параметров одного диода из исследования ученых USTC:

1. Физическая емкость матрицы на 200 Мп:
- Емкость одного диода: 8 градаций состояний = 3 бита информации (2 ↑ 3 = 8).
- Общее количество пикселей: N_d = 200 * 10 ↑ 6 диодов.
- Расчет емкости:
  N_b = 200 * 10 ↑ 6 * 3 = 600 * 10 ↑ 6 bits
  C_mem = 600 * 10 ↑ 6 / 8 = 75 * 10 ↑ 6 bytes = 75 MB

То есть матрица размером 200 мегапикселей — это физический накопитель быстрой нейроморфной памяти объемом примерно 75 Мегабайт.

2. Сколько это «в объектах»?
Кажется, что 75 МБ — это немного по меркам современных флешек. Но для аппаратной нейросети это гигантский объем!

- Если хранить «сырые» черно-белые изображения:
  Если бы мы просто записывали в матрицу маленькие иконки объектов размером 64 * 64 пикселя (где каждая иконка весит около 1.5 КБ), в 75 МБ поместилось бы ровно 50 000 прямых эталонных снимков.

- Если хранить параметры нейросети (синаптические веса):
  В нейроморфных системах матрица хранит не «картинки», а весовые коэффициенты сверточной нейросети.
  Модель сверточной нейросети среднего размера (например, MobileNet или ResNet-18, которые отлично распознают тысячи классов объектов) весит всего от 15 до 40 МБ.
  На чипе в 75 МБ поместится полноценная глубокая нейросеть с десятками миллионов параметров!

Что сможет делать такой «фотоглаз» на 200 Мп?
Матрица такого масштаба сможет удерживать в себе весовые коэффициенты для одновременного распознавания десятков тысяч сложных классов (все известные виды транспорта, тысячи пород животных, любые варианты дорожных знаков, лица людей, типы дефектов на производстве) и при этом одновременно выполнять базовую обработку: фильтрацию шумов, сжатие, трекинг движения и сегментацию сцены на лету — и всё это прямо на плоскости самого фотосенсора!

Комментарии