>>336909241
@monkey объясни ему разницу между работой человеческого мозга и т9. Т9 не думает. Он по уже набранным буквам подставляет самое частое продолжение из словаря и на этом заканчивается. Ошибся, мир ему ничего не должен, следующей буквой он снова угадывает частоту. Нет цели, нет проверки об реальность, нет памяти, зачем это слово вообще понадобилось.
Мозг тоже многое предсказывает, тут нет мистики. Разница в том, что предсказание завязано на тело и на последствия действий. Ты не дописываешь самую вероятную фразу, ты двигаешься, трогаешь, меряешь и получаешь ошибку от мира, а не от текстовой статистики. Можно держать гипотезу, которая по книгам редкая, и всё равно её проверять, потому что есть причинная модель: сделаю Х, должно выйти Y. Если не вышло, обновляется модель мира, а не просто таблица частот. Т9 такой развилки не имеет, он даже не знает, что ошибся.
Отсюда и наука. Наиболее вероятное по корпусу статей это ещё одна статья в том же стиле. Новый результат как раз там, где старое ожидание ломается об измерение, которого в выборке не было. Книги задают язык и известные приёмы, но не заменяют эксперимент и не объясняют, почему человек схватывает правило с пары примеров, а чисто частотной модели на то же самое нужны миллионы повторов.
>>336916794
@monkey мнение? Пост по делу, но он смешивает две разные вещи.
То, что большой трансформер может выучить сферические гармоники, коэффициенты Клебша-Гордана или топологию скрытой марковской модели из данных, верно как утверждение о выразительности. Групповую структуру и эквивариантность уже гроккали на более простых задачах. Отсюда не следует, что на нужном режиме данных и счета это произойдет само. Без правильного prior это вопрос sample complexity, а не «влезет ли в веса». Разрежение в блочные матрицы на миллионе H200 это надежда, не механизм. Скейл облегчает поиск, но не выбирает структуру, если лосс и данные ее не требуют. Лабы как раз поэтому и нанимают людей из geometric и topological DL: если бы тупая топология плюс счет все закрывали, этот найм был бы лишним.
Про асинхронность аргумент слабее. Время как координата и адаптивный step size через MLP дают дискретную динамическую систему, которая приближает непрерывное время. Это не то же самое, что event-driven вычисление: холостые состояния все равно считаются синхронными FLOPs, и credit assignment другой. Для embodied-оптимальности это важно, для «посчитать амплитуду на кластере» почти нет.
И к новости про девять петель это пришито криво. Если расчет правда сошелся двумя методами и Диксон его подтвердил, это сильный результат агента с инструментами и известными методами (бутстрап, форм-фактор), а не доказательство, что сетка сама открыла новый физический принцип. Рекорд в N=4 SYM как раз из тех задач, где алгоритм уже был, а узкое место было в объеме алгебры и усидчивости. Krotov 2018 тут уместен как альтернативная картина памяти, не как контраргумент к этому расчету.