Недавно писал про
рамблинг (rambling) - уже устоявшийся формат работы с ИИ-агентами и, не побоюсь этого слова, индустриальный стандарт вайбкодеров. Да, это когда вы наговариваете задачи, мысли, правки голосом без клавиатуры. Честно скажу, мой путь к такому взаимодействию с ИИ был чертовски сложен. Я человек клавиатуры. Был.
Ну правда, как только я научился писать и читать, довольно быстро понял, что для меня это самый комфортный путь донесения информации до остальных. Риторика и ораторское искусство вообще не мой конек. Мне сложно одновременно говорить и думать, а вот печатать и обдумывать каждую формулировку легко и приятно.
Как же бесили голосовые от людей. Ну блин, чувак, имей уважение, сформулируй мысль и набери ее текстом. Зачем мне тратить десять минут, чтобы понять твою идею, вместо того чтобы прочесть ее за десять секунд?
И только недавно я понял, что эти люди просто не хотели тратить кучу времени на формулировки, а предоставляли это «удовольствие» мне. Записывали десятки эмоциональных голосовых с кучей слов-паразитов, возгласов и мыслей вдогонку, чтобы уже я, послушав их сбивчивую речь и задав кучу вопросов, понял, что они хотели сказать. Короче, использовали как нейросеть, перекладывая на меня это бремя сбора и фильтрации контекста в идею. Загружая мои вычислительные мощности и экономя на своих.
А раз по ту сторону экрана у нас не живой человек, а огромная стойка с видеокартами, какого фига я их должен жалеть? Пусть машина тратит свой компьют на вычисление того, что я хочу до нее донести. Пусть задает вопросы, вспоминает наши предыдущие диалоги, копается в интернете и фильтрует мои слова-паразиты. Чего тут стесняться?
Не, ну есть еще и другие причины, почему я перестал печатать и стал рамблить. Скорость изменений в ИИ обогнала скорость моей печати. Каждый день выходит что-то, что надо разобрать, проверить руками, объяснить аудитории. В голове висит десяток тем и пять проектов. И узкое место тут не модель и не железо. Узкое место это я, когда сажусь формулировать.
У Карпатого в описании концепции «рамблинга» есть главный тезис. Когда ты печатаешь свои запросы и выкидываешь из контекста идеи, которые не можешь красиво сформулировать в тексте, модель просто недополучает биты. Не слова, а биты информации. Чем беднее вход, тем больше модель добивает пропуски средним по распределению. А среднее по распределению это и есть та безликая жвачка, которую все ругают.
Про биты и скорость сказал. Теперь два неочевидных момента.
Первое, выключенный цензор. В потоковой речи фильтры не успевают включиться. Остаются сомнения, неудачный прошлый опыт, и «почему я хочу именно так». Все то, что я раньше вычеркивал первым, считая шумом. А это и есть самая ценная часть. Именно «почему» разруливает спорные решения, когда агент делает выбор за меня.
А, ну и можно передумать вслух. Прямо посреди фразы сказать, нет, забудь про кнопку, давай список. Модель понимает поправку нормально. А еще можно давать эмоции. Раздражение это самое крутое описание границ задачи, которое у вас есть. В письменном промпте эмоция выкидывается первой, а с ней уходит половина требований. Так что ругайтесь, это помогает.
Второе. Мы говорим быстрее, чем печатаем. Но читаем быстрее, чем слушаем. Именно поэтому мне не заходит разговор с ИИ голосом. Я хочу диктовать и читать. Голос на вход, текст на выход. Наговорил за минуту то, что печатал бы десять, и получил на выходе текстовый ответ или визуальный концепт.
Короче, пока меня бесит медленно слушать то, что можно быстро прочитать. Когда уже внедрят возможность увеличивать скорость проигрывания? Хотя лучше чип в мозг.
Вы как, уже приняли для себя новую реальность и купили микрофон, встроенный в намордник для опенспейсов?