Nadie escribe en WhatsApp como escribe un correo. La gente manda así:

hola quería hacerme los pies ¿cuánto sale?

Tres mensajes en ocho segundos. Para quien escribió, es una pregunta. Para un sistema que responde mensaje por mensaje, son tres — y el cliente recibe un saludo, un precio y una pregunta sobre el horario, todo atropellándose, a veces fuera de orden.

El problema no es que la IA sea tonta. Es que es demasiado rápida para el modo humano de conversar.

Qué pasa cuando cada mensaje se vuelve un turno

Además de la incomodidad visual, hay tres daños concretos:

Las respuestas se contradicen. Cada respuesta se genera con lo que existía hasta ese instante. La primera no sabía que la clienta quería los pies; la segunda no sabía que iba a preguntar el precio. Vistas juntas, parecen tres agentes diferentes.

Las acciones se ejecutan con el contexto a medias. En una conversación real que analizamos, la clienta escribió "como a las 16 horas", después "hoy", después "no" — y un cobro salió un segundo después del "no", porque el turno que lo generó había empezado antes.

El costo se duplica. Cada mensaje se vuelve una llamada al modelo. Tres mensajes a trozos cuestan tres veces lo que costaría una sola respuesta, para entregar una atención peor.

Esperar es la solución — ¿pero cuánto?

La salida es simple de decir: espere un poco antes de responder y, si llega un mensaje nuevo en ese intervalo, responda una vez, por todas.

Lo difícil es el número. Cinco segundos resuelven la mayoría de los casos. Pero quien escribe despacio — y es justamente quien manda "hola" primero para "avisar que llegó" — tarda quince, veinte segundos en mandar la pregunta de verdad. Con ventana fija, el "hola" se gana un saludo solo y la pregunta real llega después.

Aumentar la ventana para todos tampoco sirve: quien manda una pregunta completa de entrada queda esperando en vano, y parecer lento es un problema real en un canal donde la expectativa es respuesta inmediata.

La señal que WhatsApp ya da

Existe un dato que resuelve esto y casi nadie usa: el "está escribiendo…".

WhatsApp avisa cuando la persona está escribiendo. Una asistente puede usar exactamente esa señal — espera el tiempo base y, mientras el cliente siga escribiendo, sigue esperando, hasta un techo. Es lo que hace una recepcionista: ve que la persona está escribiendo y retiene la respuesta.

Una regla complementaria ayuda en el caso más común de todos: cuando el primer mensaje es solo un saludo ("hola", "buen día"), la espera se duplica. Un "hola" solo es casi siempre el comienzo de una ráfaga — la pregunta viene justo detrás.

Situación Qué hace la IA
Una pregunta completa Responde tras la espera corta
Tres mensajes a trozos Junta todos y responde una vez
"Hola" solo Espera el doble — la pregunta viene ahí
Cliente todavía escribiendo Sigue esperando, hasta un límite

Un efecto secundario bueno

Agrupar la ráfaga no mejora solo la conversación. Mejora la consistencia: con el contexto completo, la respuesta considera los tres mensajes juntos, y la probabilidad de contradicción baja. Y mejora el costo, porque una respuesta sustituye tres.

Es uno de esos ajustes que nadie elogia cuando funciona — el cliente solo siente que "está conversando bien". Pero es la diferencia entre una asistente que parece atenta y una que parece atropellada.

Para otros comportamientos que hacen que la IA suene natural, vea cuándo la IA debe pasar a un humano e agente de IA que responde solo.