Информатика
Язык, который не влияет на то, как вы думаете о программировании, не стоит изучать.
— (1982)
Опытным разработчикам казалось, что с ИИ они работают быстрее, хотя измерения показали обратное — вот настоящий результат, а не приговор ИИ-программированию
В рандомизированном контролируемом исследовании METR шестнадцать опытных разработчиков открытого ПО выполнили 246 реальных задач в хорошо знакомых им кодовых базах; для случайной половины задач разрешались ИИ-инструменты начала 2025 года (Cursor Pro вместе с Claude 3.5/3.7 Sonnet). Они ожидали, что ИИ сократит время выполнения примерно на 24%; вместо этого он увеличил его на 19%, а после работы разработчики всё равно считали, что ИИ ускорил их примерно на 20%. Именно этот разрыв в восприятии — самое ясное и устойчивое ядро исследования. Но это шестнадцать разработчиков, одна узкая среда и фиксированный снимок начала 2025 года: авторы прямо говорят, что результат не показывает, будто ИИ не помогает большинству разработчиков, а их собственное продолжение 2026 года уже склоняется в сторону ускорения — со своими оговорками.
Криптографическое доказательство может скрывать секрет, делая отсутствие симулятора трудным для доказательства
Доказательства с нулевым разглашением позволяют доказать утверждение, не раскрывая witness. Классическая теория говорит, что в полном смысле это невозможно одновременно с одним сообщением, отсутствием доверенного setup и perfect soundness. Статья Рахула Иланго не отменяет эту невозможность. Она меняет цель: вместо требования, чтобы симулятор действительно существовал, достаточно, чтобы никакая выбранная система доказательств не могла эффективно доказать, что симулятора не существует. При сильных предположениях из теории сложности доказательств и криптографии этого хватает, чтобы по одному свойству за раз восстановить фальсифицируемые, игровые последствия zero-knowledge. Это не готовый интернет-примитив, а теоретико-доказательственный способ превратить математическую недоказуемость в криптографическое прикрытие.
Медицинский ИИ может быть приватным в среднем и одновременно раскрывать отдельных пациентов — особенно недопредставленных
Когда медицинскую модель ИИ называют «сохраняющей приватность», это обычно основано на одном среднем показателе. Это исследование показывает, что такая проверка неверна. Изучая атаки на определение принадлежности к обучающей выборке — они позволяют выяснить, была ли запись конкретного человека в обучающих данных модели и тем самым могут раскрыть, что у человека было определённое заболевание, — авторы измеряли риск не в совокупности, а для каждого пациента отдельно, на семи медицинских датасетах (изображения, ЭКГ, электронные записи) и множестве моделей. Картина такова: модели, безопасные по среднему показателю, иногда позволяют почти безошибочно идентифицировать конкретных людей (AUC атаки ≥ 0,95); среди раскрываемых систематически преобладают недопредставленные группы — этнические меньшинства, редкие болезни, необычные изображения; а с увеличением моделей проблема усиливается. Авторы не призывают отказаться от медицинского ИИ — они предлагают измерять приватность для каждого пациента, контролировать доступ к моделям и применять дифференциальную приватность. Неудобная суть: «приватна в среднем» — не гарантия приватности, и чаще всего она подводит тех пациентов, которые и без того защищены хуже всего.
Научить AI-художника смотреть на страницу
Языковые модели, генерирующие векторную графику, обычно делают это вслепую — пишут команды рисования, ни разу не увидев результат. Новый метод позволяет модели наблюдать, как холст заполняется штрих за штрихом, и честный поворот состоит в том, что просто дать ей глаза делает результат хуже: модель нужно переобучить ими пользоваться. В итоге она сравнивается или слегка превосходит конкурентов, обученных на данных объемом до двадцати раз больше, — реальный, но осторожный результат одного бенчмарка, а не революция.
ИИ-агент самостоятельно вёл целые клинические случаи — в симуляторе, на прошлых медицинских записях
MIRA — новый тип медицинского ИИ: вместо ответа на один вопрос система ведёт весь случай внутри симулированной больничной карты — собирает анамнез, назначает и читает исследования, приходит к диагнозу и формирует назначения. На 574 ретроспективных случаях из публичной базы, охватывавших восемь заранее выбранных диагнозов, авторы сообщают о более высокой, чем у врачей, точности диагноза и преимущественно безопасных решениях, согласующихся с рекомендациями. Но каждое уточнение здесь важно: система работала в песочнице на прошлых записях и только с текстом; значительная часть преимущества пришлась на состояния с однозначными тестами; она использовала примерно вдвое больше анализов крови, чем врачи; а несколько результатов оценивали относительно того, что было записано в исходной карте. Настоящий шаг вперёд — агент, действующий в рамках всего рабочего процесса, а не доказательство того, что машина теперь диагностирует лучше врача. Сами авторы подчёркивают: обобщаемость, безопасность и управление ещё требуют проспективных исследований в реальном мире.
Действительно ли большие «фундаментальные модели» роботов работают лучше? Осторожный ответ: умеренно да — и большинство исследований не способны надёжно это увидеть
Toyota Research Institute обучил «большие модели поведения» — роботизированные политики с предварительным обучением примерно на 1 700 часах разнообразных манипуляций — и сравнил их с моделями одной задачи, обученными с нуля, с необычной строгостью: слепые рандомизированные испытания большого масштаба (~1 800 реальных и 47 000+ симуляционных) с настоящей статистикой. После дообучения на конкретной задаче большие модели в среднем работали лучше, требовали примерно в 3–5 раз меньше специфичных данных и были устойчивее к изменению условий; производительность плавно росла с объёмом pretraining-данных. Но без дообучения они не имели стабильного преимущества над моделями одной задачи, некоторые эффекты были настолько малы, что становились видимыми только в больших выборках, а обычный выбор нормализации данных значил больше архитектуры. Это сдержанная поддержка направления фундаментальных моделей для роботов — не универсальный робот, не zero-shot универсал и не «эмерджентный скачок» — плюс острое предупреждение, что значительная часть робототехники может измерять шум.
Почему языковые модели галлюцинируют — и почему наша система оценки помогает этому продолжаться
Уверенные ложные утверждения, которые мы называем «галлюцинациями», не являются загадочным сбоем: часть из них — статистический побочный эффект обучения, а сохраняются они еще и потому, что главные бенчмарки вознаграждают уверенную догадку сильнее честного «я не знаю». Case study на четырех frontier-моделях показывает, что явное формулирование правил оценки в самом запросе — «open rubrics» — переворачивает этот стимул.