Появился открытый проект, который пытается распознавать неисправности автомобиля по аудиозаписи двигателя. Он учится на «шумных» роликах из соцсетей и честно показывает, где работает уверенно, а где лучше сразу сказать «не знаю».
Идея кажется почти фантастической: записать звук мотора на смартфон и получить подсказку, в каком узле искать проблему. Именно так работает cardiag — открытая система, которую разработчик Адам Сон выложил в публичный доступ.
Проект не обещает «заменить мастера». Он рассчитан на первичную диагностику: сузить круг подозреваемых и подсказать, с чего начать проверку.
Как проект учится на «реальной жизни», а не на идеальных лабораторных записях
Главная особенность cardiag — источник данных. Вместо дорогих датасетов с эталонными записями проект сам собирает примеры: скрейпит ролики с признаками поломок из YouTube и TikTok, а затем прогоняет звук через каскад очистки, чтобы отделить механику от речи, музыки и дорожного шума.
Дальше используется «замороженная» аудиомодель CLAP: она превращает аудио в эмбеддинги. А поверх этих эмбеддингов работают простые линейные классификаторы. Большие модели не дообучаются — обученная часть системы занимает порядка 100 КБ (сама CLAP при этом значительно больше).
Что умеет — и где честно признаёт ограничения
Автор публикует метрики без попытки приукрасить результат:
- AUROC 0.79 для задачи «исправна/неисправна» — лучше случайного угадывания, но не «точность сервиса дилера»;
- в 76% случаев нужный узел (двигатель, тормоза, ходовая и т.д.) попадает в топ‑3 вариантов, которые предлагает система;
- конкретная деталь оказывается в коротком списке в 3–4 раза чаще, чем при случайном выборе.
При этом автор показывает, что метод не обязательно «слабый» сам по себе. На более чистых записях двигателей из независимого бенчмарка тот же подход достигал AUROC 0.93. Вывод простой: качество ограничивают прежде всего «шумные» данные из соцсетей.
Почему это важно обычным водителям (и тем, кто покупает авто с рук)
Если вы слышите странный звук и не понимаете, это «так и должно быть» или уже повод ехать в сервис, подобный инструмент может помочь в бытовых сценариях:
- перед покупкой подержанного авто — как дополнительный сигнал «проверить внимательнее»;
- после замены деталей — чтобы сравнить поведение до/после ремонта;
- в дороге, когда нет возможности быстро получить консультацию, — хотя бы понять, насколько ситуация похожа на типовые поломки.
Но здесь же важно держать границу: звук — не полный диагноз. Даже удачное «попадание в узел» не означает, что можно заказывать запчасти без проверки.
Инженерная аккуратность: как проект защищается от самообмана
В подобных задачах легко случайно «натренировать» модель на шум, а не на смысл. В cardiag автор делает несколько вещей, которые повышают доверие к результатам:
- кросс‑валидация сгруппирована по исходным видео, чтобы фрагменты одного ролика не попадали одновременно в обучение и тест;
- статзначимость проверяется permutation‑тестом;
- вероятности калиброваны — заявленные «70% уверенности» ближе к реальной точности, а не к красивой цифре;
- если аудио не даёт сделать вывод, система может вернуть UNCERTAIN вместо уверенной догадки.
Отдельно автор описывает и собственные неудачи. Например, детектор «стука в двигателе» показывал почти идеальные результаты на знакомых данных, но на чужих записях скатывался к уровню случайности — и этот детектор исключили из основных итогов, оставив только как подсказку.
Что будет дальше
Самый очевидный путь развития — улучшать качество входных данных (например, учиться выделять «чистую механику» ещё точнее) и расширять набор проверяемых сценариев. Но даже в текущем виде проект показывает интересную развилку: иногда прогресс в прикладном ИИ упирается не в «ещё одну гигантскую модель», а в то, как аккуратно собрать и разметить реальный мир.
