Agentes de IA en la empresa: qué hace bien, qué hace mal y qué sigue haciendo un humano

Seis semanas con un agente trabajando

Llevamos dos años oyendo hablar de agentes de IA. Muy poca gente cuenta qué pasa cuando pones uno a trabajar de verdad, con documentación real, personas reales que dependen de sus respuestas y un responsable que tiene que firmar lo que sale por la puerta.

Hace seis semanas monté uno para un cliente: una empresa de servicios B2B de unas ciento veinte personas, con un equipo de atención que responde a diario preguntas sobre condiciones de servicio, procedimientos y plazos. Nada exótico: el trabajo administrativo que hay en cualquier empresa mediana.

Este artículo es el parte honesto de esas seis semanas. Qué le pedimos, qué hace bien, dónde se cae, cuánto trabajo hubo que hacer antes de que la IA entrara en escena y en qué momento la respuesta sigue teniendo que pasar por una persona. Sin entusiasmo de feria y sin escepticismo de bar.

Qué le pedimos exactamente al agente

Lo primero que conviene aclarar es que un agente no es un chatbot genérico. La diferencia práctica es de dónde saca la información: un asistente general responde con lo que sabe del mundo, y un agente responde con lo que tú le has dado, y debería negarse cuando eso no le alcanza.

Le dimos tres fuentes: el manual de procedimientos internos, las condiciones de servicio vigentes y un histórico de unas dos mil consultas resueltas por el equipo de atención en los últimos tres años. Nada más. Ni internet, ni datos de clientes, ni el correo de nadie.

Y le pedimos tres tareas concretas, no «que ayude»: localizar el procedimiento que aplica a una consulta, resumir en cinco líneas lo que dice ese procedimiento, y preparar un borrador de respuesta al cliente con el tono que usa la casa. Tres tareas acotadas, medibles y verificables. Esa concreción es la mitad del éxito del proyecto.

Lo que hace bien: buscar, resumir y redactar

En estas tres tareas el resultado ha sido mejor de lo que esperaba, y el motivo es poco glamuroso: son tareas de búsqueda y redacción sobre un material acotado, exactamente donde estos modelos son fuertes.

Buscar. Antes, encontrar el procedimiento aplicable podía llevar entre diez y veinte minutos si la persona era nueva, porque implicaba saber dónde mirar y con qué palabras. El agente lo devuelve en segundos y, lo que más ha sorprendido al equipo, acierta también cuando la consulta está mal formulada o usa la palabra que usa el cliente y no la que usa la empresa.

Resumir. Los procedimientos largos se leían en diagonal, con el riesgo evidente. Un resumen de cinco líneas con el enlace al documento completo ha hecho que la gente lea más, no menos.

Redactar. El borrador de respuesta es el ahorro grande. No porque escriba mejor que una persona, sino porque elimina el arranque desde cero, que es la parte lenta. La persona revisa, ajusta el matiz y envía.

En conjunto, el equipo estima que ha recuperado entre cuatro y seis horas semanales de trabajo repetitivo. No es una revolución, es una jornada. Pero es una jornada cada semana y no hay que pelearse con nadie para conseguirla.

Hay además un efecto que no esperaba y que el responsable del equipo valora más que las horas: las respuestas se han vuelto más homogéneas. Antes, la misma consulta podía recibir tres redacciones distintas según quién la cogiera, con matices que a veces importaban. Partir siempre del mismo borrador ha reducido esa dispersión sin necesidad de escribir ni un solo procedimiento nuevo.

Lo que hace mal: el día que se inventó una respuesta

El tercer día, el agente afirmó con toda naturalidad que cierto servicio incluía una revisión gratuita a los seis meses. Redactado impecable, tono correcto, párrafo convincente. Esa condición no existía en ningún documento.

Lo que había pasado es lo que pasa siempre: la documentación no cubría ese caso concreto, y en vez de decir «no lo sé», el modelo completó el hueco con lo que le parecía razonable a partir de casos parecidos. Es el fallo característico de esta tecnología y conviene entenderlo bien, porque no se arregla del todo: se acota.

Y el problema real no es que se equivoque. Las personas también se equivocan. El problema es que se equivoca con el mismo tono de seguridad con el que acierta. No hay ninguna señal en el texto que distinga una respuesta documentada de una deducida. Por eso, en cualquier proceso donde la respuesta salga al exterior, la revisión humana no es una fase de rodaje: es parte del diseño.

Lo que sí redujo mucho el problema fueron tres decisiones: instrucciones explícitas para responder «esto no está en la documentación» antes que aproximar, obligar al agente a citar el documento y el apartado del que saca cada afirmación, y marcar en rojo cualquier respuesta sin cita. Con eso, las invenciones pasaron de aparecer varias veces por semana a ser una rareza. No desaparecieron.

Y una nota para quien vaya a montar uno: la tentación es pedirle al agente que sea útil por encima de todo. Es justo al revés. Las instrucciones que mejor funcionan son las que le dan permiso explícito para quedarse corto, porque un «no lo sé» cuesta dos minutos de una persona y una invención cuesta una reclamación.

El 70% del trabajo no fue la IA

Si tuviera que quedarme con una sola lección de estas seis semanas, sería esta: montar el agente fue lo rápido; prepararle el terreno fue el proyecto.

La documentación estaba repartida entre una carpeta de red, un SharePoint y los adjuntos de varios correos. Había tres versiones del mismo procedimiento sin fecha y sin manera de saber cuál mandaba. Había condiciones derogadas en 2024 conviviendo con las vigentes. Un agente alimentado con eso no es un asistente: es un generador de errores rápido.

El trabajo previo, que ocupó la mayor parte del tiempo, consistió en reunir todo en un único sitio, retirar lo caducado, poner fecha y responsable a cada documento y decidir explícitamente a qué podía y a qué no podía acceder el agente. Nada de esto suena a inteligencia artificial y todo esto determina el resultado.

Conviene verlo por el lado bueno: ese trabajo no se tira. Ordenar la documentación mejora la vida del equipo con agente y sin él. Si tu empresa está pensando en un proyecto de IA y descubre por el camino que necesita ordenar su información, no ha perdido el tiempo: ha encontrado el problema de verdad.

De hecho, la pregunta que uso ahora en la primera reunión de cualquier proyecto de este tipo no es qué quieres automatizar, sino dónde está escrito lo que el agente va a tener que contestar. Si la respuesta tarda en llegar o empieza por «bueno, depende de a quién preguntes», ya sé por dónde va a ir el proyecto.

Qué cuesta y cuándo merece la pena

El coste tiene tres partidas, y solo una es la licencia. Está la plataforma, con un coste mensual moderado y predecible para un caso de uso como este. Está el tiempo de puesta en marcha, que en este proyecto fue mayoritariamente el trabajo de ordenar documentación. Y está el mantenimiento, que es la partida que la gente olvida: cada vez que cambia un procedimiento, hay que actualizar la fuente, y alguien tiene que ser responsable de eso.

Mi criterio para recomendarlo, después de este proyecto y de algún otro que no salió tan bien, es sencillo. Merece la pena cuando se dan tres condiciones a la vez: hay un volumen alto de preguntas repetitivas, la respuesta está en documentación que la empresa controla, y existe una persona que revisa antes de que la respuesta salga. Si falta cualquiera de las tres, yo hoy no lo montaría.

Y una advertencia sobre las expectativas. Un agente no reduce plantilla en una empresa mediana: reduce la parte aburrida del trabajo de la plantilla que ya tienes. Quien lo compre esperando lo primero se va a llevar un disgusto, y de paso va a enfrentar al equipo con la herramienta desde el primer día.

Conclusión

Después de seis semanas, mi resumen cabe en una frase: un agente es muy bueno buscando y redactando sobre lo que tú le has dado, y muy malo sabiendo lo que no sabe. Todo lo demás son consecuencias de eso.

Por eso los proyectos que funcionan se parecen mucho entre sí: alcance pequeño, documentación controlada, obligación de citar la fuente y una persona que revisa lo que sale. Y los que fracasan también se parecen: alcance enorme, documentación desordenada y nadie responsable de la respuesta final.

Tu próximo paso, si estás valorando uno: coge las diez preguntas que más veces responde tu equipo cada semana y comprueba si la respuesta está escrita en algún sitio que la empresa controle. Si lo está, tienes un caso. Si no lo está, ya sabes cuál es el primer proyecto, y no es de inteligencia artificial.

Únete a la conversación

¿Qué te ha parecido? Comparte tu experiencia o tu pregunta en los comentarios.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *



    DigitoCero © 2024 | Desarrollo web: cromo.com.es