Одни – для текста, другие – только для генерации фотографий, третьи идеально создают видео, а какие-то и вовсе становятся персональными помощниками в рабочих делах и могут отправить письмо с отчетом, пока вы пьете раф на кокосовом. Tamga Media разбиралась в сильных сторонах разных ИИ и немного углубилась в историю.
Первый AI
Идея искусственного интеллекта появилась раньше, чем можно представить – еще в 1950 году. И это не было плодом фантастического произведения. Британский математик Алан Тьюринг в своей работе задал абстрактный вопрос «Могут ли машины мыслить?», перевел его в практическую плоскость и предложил модель, которая называлась «Тест Тьюринга». Он считал, что если машина успешно имитирует поведение человека в переписке, то она интеллектуальна. Понятно, что невозможно написать сразу человеческую модель, поэтому он предложил сделать «детские» модели. Идея в том, чтобы создать математические модели, которые бы обучались на опыте. Прямо, как дети обучаются у взрослых, постепенно вырастая.
Проблема заключалась в том, что компьютеры в то время вообще ничего не умели. Им прописывали жесткие инструкции, которые они должны были выполнять на автомате – если случилось А, значит, результат будет Б.
Уже в 1956 году на конференции в Дартмуте был официально признан термин Artificial Intelligence.

С 1970 до начала 2000 ИИ почти не развивался. Ожидания от него были завышены, не было достаточно данных, технологии не обладали мощностью, а инвестируемые деньги заканчивались.
Почти 30 лет стагнации закончились с появлением Интернета, мощных видеокарт и огромных массивов данных. В это время появилось машинное обучение, в рамках которого машине не прописывали точные правила поведения, а показывали примеры, в которых надо было найти закономерность.
Обучение проходило не по принципу «это кошка, потому что у нее треугольная форма ушей, есть усы и хвост», а по принципу показа тысячи фотографий разных кошек. Система сама училась понимать, что между ними общего, находить закономерности и могла заявить «да, это кошка».
В 2012 году команда из Торонто создала нейросеть AlexNet, которая перевернула представление о машинном обучении. В то время как все нейросети ошибались в 25% случаев, AlexNet ошиблась всего в 15%. С этого начался бум deep learning, после которого и появились голосовые ассистенты, переводчики, генераторы изображений и ИИ-чаты.
Как работают AI-модели
Языковые модели вроде ChatGPT угадывают следующие слова (вроде Т9). Модель не понимает смысл слов, которые вкладывает человек, но насмотревшись на миллионы похожих предложений, предугадывает, что может идти дальше и выбирает самый вероятный вариант. И таких угадываний не одно, а миллиарды подряд.
Спустя годы обучения, появились технологии, которые помогают учитывать контекст, запоминать, что было сказано ранее и связывать все воедино.
С изображениями все устроено иначе. Сначала берется картинка, затем машина превращает ее в шум, наподобие заставки на экране телевизора, когда тот не работает – сплошные помехи. Затем из шума машина восстанавливает изображение. Получается, что модели не генерируют картинку с нуля, а воспроизводят максимально близкую к заданному запросу.
Видео – это большое количество картинок, выстроенных подряд. Но есть и сложности – все картинки должны быть связаны между собой, а кот на первом кадре должен оставаться тем же самым, что и на последнем. Видео-модели учитывают одновременно внешний вид, движение и физику персонажей.
Важно понимать, у AI нет мозга и сознания, а рекомендации и информацию он дает лишь потому, что видел огромное количество примеров, и научился более или менее точно предсказывать, что должно быть дальше – в тексте, картинке, звуке или на видео.
Самые классные AI-модели
Существуют десятки тысяч моделей, включая узкоспециализированные. Какие-то заточены под написание кода, другие – под ретушь фотографий, а третьи – для описания расклада таро. Важно выбирать модель под задачи, которые вам необходимо решить.
Только языковых моделей на рынке больше 300. И их количество постоянно растет. Тем не менее, в постоянном обиходе есть 20-40 моделей.
В ядре рынка – ChatGPT от OpenAI. Это универсальная модель, которая помогает писать тексты, придумывать стратегии и маркетинговые идеи и даже неплоха в написании кода. Модель хорошо работает с изображениями и голосом и может точно обрабатывать файлы с данными. Минусы есть – периодически ChatGPT привирает, его надо перепроверять, и он не такой креативный, как другие модели.Следующий по популярности – Claude от Anthropic. Он помогает в работе с длинными текстами, финансовой аналитикой, документами и переводами на разные языки. Он лучше других сконцентрирован на больших объемах и пишет максимально человеческим языком. Возможно, хуже работает с кодом, и нет полноценной мультимодальности.
Gemini от Google DeepMind интегрирован в Google сервисы, поэтому хорош в вопросах поиска и анализа, может читать объемные документы (вплоть до книг). Так как его сильная сторона – аналитика, по поводу креативности лучше обращаться к другим моделям. Но если вы еще и пользуетесь экосистемой Google (документы, таблицы, WorkSpace), это – лучший вариант.
Llama от Meta заточен для аналитических задач, а также помогает в бизнес-решениях и создании, собственно, AI-модели. Для хорошей работы придется настроить его под свои запросы.
Grok от xAI (Илон Маск) следит за последними трендами, может выдать запросы из соцсети Х и достаточно неплох в актуальной повестке. В сравнении с другими, может быть не таким точным и не так хорош в аналитике и работе с большим объемом информации, но последние новости отслеживает отлично.
Кто такие AI-агенты
Точнее, что. Это автономные системы на базе LLM (больших языковых моделей), которые способны выполнить многошаговые задачи, используют дополнительные внешние инструменты (калькулятор, Excel) без постоянного участия человека. В отличие от AI-чатов, они выполняют функцию виртуального ассистента, который может рассуждать и отправлять письма, пока вы заняты другими делами.
Один из популярных примеров – Perplexity. Он связан с браузером Comet, умеет искать и объяснять информацию, открывать сайты и анализировать информацию, писать и отправлять письма, бронировать и покупать билеты. В общем, все, о чем можно мечтать.
Open-source агент OpenClaw тоже может писать письма, запускать скрипты и работать с файлами, а Moltbot управляет календарем и с радостью берет на себя общение с клиентами.
Существуют также ChatGPT Atlas, который встроен в браузер и выполняет задачи, Monica (расширение для Chrome), который пишет посты прямо на сайте, и BrowserCopilot AI, который объединил ChatGPT, Claude и Gemini.
Если вы не хотите подчинять ИИ свой браузер со всеми паролями, можно воспользоваться помощниками для почты – Superhuman и Aeralis – они умеют писать письма в вашем стиле.



