Todos los artículos

// Agentes en producción

Agentes IA en Klarna: 3 Capas de Juicio y el Humano Bajo Demanda

Klarna automatizó 853 agentes IA y ahorró 60M anuales, pero su retroceso de 2025 reveló que no toda interacción se automatiza igual: hay 3 capas de juicio.

25 de agosto de 202610 min de lectura

Agentes IA en Klarna: 3 Capas de Juicio y el Humano Bajo Demanda

Serie: Construyendo con IA — Parte 10. El caso de Klarna es el ejemplo más público de agentes IA en customer service a escala planetaria. Pero la lección no está en los 853 agentes que automatizó. Está en el momento en que tuvo que traer humanos de vuelta — y por qué eso no fue un fracaso, sino la arquitectura correcta llegada tarde.

El anuncio que cambió la conversación

En febrero de 2024, Klarna y OpenAI hicieron un anuncio conjunto: un asistente de IA había gestionado 2.3 millones de conversaciones en su primer mes — el equivalente al trabajo de 700 agentes a tiempo completo. Los números eran imposibles de ignorar:

  • 2/3 de todos los chats de customer service automatizados
  • Tiempo de resolución: 11 minutos → menos de 2 minutos
  • 25% menos consultas repetidas
  • CSAT a la par de agentes humanos
  • 23 mercados, 35+ idiomas, 24/7
  • $40M USD proyectados en mejora de utilidades para 2024

La industria leyó esto como prueba de que los agentes IA podían reemplazar a los humanos en customer service. Y durante un tiempo, parecía cierto.

⚠️El truco del promedio

El CSAT agregado se mantuvo estable durante meses. Pero los promedios esconden distribuciones. La satisfacción en consultas simples subió. La satisfacción en disputas complejas se desplomó. El promedio no se movió hasta que fue demasiado tarde.

El retroceso que nadie esperó

En mayo de 2025, el CEO Sebastian Siemiatkowski le dijo a Bloomberg que la empresa había "ido demasiado lejos" y "enfocado demasiado en costo". El resultado fue "menor calidad, y eso no es sostenible". Klarna empezó a contratar agentes humanos de vuelta.

La prensa lo leyó como el primer gran revés enterprise de la IA. Esa lectura es incorrecta.

Para noviembre de 2025, en la primera llamada de resultados de Klarna como empresa pública, el asistente de IA hacía el trabajo equivalente a 853 agentes a tiempo completo — arriba desde 700 — ahorrando $60 millones anuales. La compañía había reducido su headcount de ~5,500 a menos de 3,000 personas mientras duplicaba sus ingresos. El CSAT seguía a la par de los humanos.

La IA no falló. Lo que falló fue el scope: desplegar IA en las tres capas de juicio cuando solo una estaba lista para automatización total.

Las 3 capas de juicio en customer service

El análisis post-mortem de Klarna revela que las interacciones de customer service no son un problema uniforme. Tienen al menos tres capas de juicio, cada una con características de volumen, ambigüedad y costo emocional distintas:

Capa 1 — Resolución transaccional

Estado de pedido, emisión de reembolso, reset de contraseña, cambios de plan, traducción de idioma. Volumen alto, ambigüedad baja, stakes emocionales bajos. El agente de IA de Klarna brilló aquí. El número de 853 FTE equivalentes es real, y Klarna sigue duplicando la apuesta en esta capa. Esta capa debe automatizarse totalmente. Los ahorros son durables.

Capa 2 — Juicio emocional y contextual

Un cliente está enojado pero intenta no demostrarlo. Un cliente técnicamente está equivocado sobre su elegibilidad para un reembolso, pero tiene razón en que la política es confusa. Un cliente está en dificultad financiera y la respuesta "correcta" lo empujaría más adentro.

Aquí es donde Klarna eliminó el juicio humano en 2024 y donde el piso de satisfacción se rompió. Es también la capa donde los vendors que venden "agentes" hoy son más débiles, porque los benchmarks de LLM no miden des-escalación.

🚨La trampa del LLM benchmark

Ningún benchmark mide la capacidad de un modelo para detectar frustración creciente, leer entre líneas en un mensaje educadamente redactado, o decidir que la respuesta técnicamente correcta no es la respuesta correcta. Si tu evaluación de agentes solo mide accuracy en tareas transaccionales, vas a desplegar en L2 sin saber que estás en L2.

Capa 3 — Alta complejidad y stakes

Disputas de transacciones, hardship financiero, complaints regulatorios, casos legales. Volumen bajo, pero el costo de un error es alto: churn, impacto regulatorio, daño de marca. Klarna descubrió que la IA producía respuestas genéricas e insuficientemente matizadas en estos casos, y que la diferencia entre "resuelto" y "resuelto bien" era máxima exactamente donde el cliente más lo necesitaba.

La arquitectura correcta: agente-primero, humano-bajo-demanda

El retroceso de Klarna no fue una retirada de agentes. Fue un desacoplamiento forzado de las tres capas. La contratación "estilo Uber" no es un retorno al soporte con personal humano. Es la construcción de una capa humana on-demand que se activa solo cuando el agente en L1 golpea un umbral de confianza o detecta contenido emocional.

La arquitectura resultante es:

terminal
Cliente
  │
  ▼
┌─────────────────────────┐
│   Agente IA (Capa L1)    │  ← Resuelve ~90% transaccional
│   ReAct + tool calling   │
└──────────┬──────────────┘
           │
     ┌─────▼─────┐
     │  Router    │  ← Confidence threshold + sentiment gate
     │  (producto)│
     └─────┬─────┘
           │
    ┌──────▼──────┐
    │ Humano L2/L3│  ← On-demand, escalación dirigida
    │ (gig pool)  │
    └─────────────┘

El routing entre el agente y el humano es el producto. No es un fallback. Es la pieza que decide si la experiencia funciona o se rompe.

El routing como producto: qué instrumentar

Si el routing es el producto, necesita la misma disciplina que cualquier otro servicio en producción. Esto significa:

1

1. Confidence scoring por intent class

El agente debe emitir un score de confianza para cada resolución. No un score global — un score por categoría de intención. "Estoy 95% seguro de que el reembolso procede" es diferente de "Estoy 95% seguro de que sé qué hacer con este cliente en hardship financiero".

2

2. Sentiment detection en tiempo real

Detectar frustración creciente, lenguaje pasivo-agresivo, o señales de distress financiero. Klarna descubrió que el CSAT agregado no se movió durante meses, pero las señales estaban en los datos — solo nadie las estaba mirando.

3

3. Repeat contact rate como métrica de primera clase

Un cliente que contacta soporte dos veces por el mismo problema no es un caso resuelto. Es un costo diferido con penalización de satisfacción. Esta métrica debe estar junto a containment rate en el dashboard, no enterrada en un reporte mensual.

4

4. Per-category CSAT, no agregado

El CSAT agregado suaviza los problemas exactamente donde más importan. Medir satisfacción por categoría de interacción (transaccional, disputa, hardship, regulatorio) revela el deterioro en L2/L3 antes de que se convierta en churn.

5

5. Escalación dirigida con contexto

Cuando el router envía al humano, no debe empezar de cero. El agente debe transferir el contexto completo: qué intentó, qué tools llamó, qué decidió el cliente, y por qué se escaló. Un humano que recibe un ticket en blanco después de un fallo de IA genera más frustración que el fallo original.

El lag de satisfacción: por qué los month-one numbers engañan

La lección más subestimada de Klarna es el lag de satisfacción. La satisfacción en una función de soporte es lo que los economistas llaman un indicador lagging. Las señales que produce en la semana 1 de un rollout de IA se ven casi idénticas a las señales del último trimestre con personal humano. Toma 6-12 meses para que la satisfacción decline de forma significativa, y otros 6 meses para que ese declive correlacione con churn, retención e impacto de marca.

Klarna publicó el press release en el mes 2. Para cuando el piso de satisfacción se rompió, los ahorros ya estaban contabilizados, los despidos hechos, y la narrativa del IPO construida sobre esos números.

Regla práctica

No publiques los ahorros antes de que el lag de satisfacción cierre. Si vas a medir el éxito de un agente IA en customer service, necesitas al menos 6 meses de datos por categoría de interacción antes de declarar victoria. Los números de month-one son útiles como intención, no como hecho auditado.

¿Qué significa esto para tu arquitectura?

Si estás desplegando agentes IA en customer service (o en cualquier función donde el juicio emocional y contextual importa), las lecciones de Klarna se traducen en decisiones de arquitectura concretas:

  1. No automatices las tres capas a la vez. Despliega en L1 primero. Mide per-category CSAT y repeat contact rate durante al menos un trimestre antes de expandir scope.

  2. El humano no es un fallback. Es una capa con su propio SLA, su propio pool on-demand, y su propio contexto transferido. Diseña el routing entre agente y humano como diseñarías cualquier API: con contratos, timeouts, y observabilidad de extremo a extremo.

  3. El aggregate CSAT miente. Instrumenta métricas por categoría de intención. Si tu dashboard solo muestra un número de satisfacción agregado, estás operando con la misma ceguera que Klarna en 2024.

  4. El vendor que te vende "agentes" probablemente es débil en L2. Pregunta cómo evalúa des-escalación, detección de distress, y routing de escalación. Si la respuesta es "el modelo lo maneja", no lo maneja.

  5. El modelo de pricing debe reflejar el costo real. Klarna proyectó $40M basado en desempeño de month-one en todas las categorías. El número real llegó a $60M, pero solo después de re-escalar a humanos en L2/L3. Tu modelo financiero debe incluir el costo de la capa humana on-demand, no solo el costo de inference.

Conclusión

Klarna no demostró que los agentes IA no funcionan en customer service. Demostró que los agentes funcionan, y que la arquitectura alrededor de ellos es lo que falla cuando se automatizan las tres capas de juicio como si fueran una sola.

Los números de noviembre de 2025 — 853 FTE equivalentes, $60M en ahorros, ingresos duplicados con la mitad del headcount — son el resultado enterprise de IA más fuerte en el registro público. El retroceso de mayo de 2025 es la historia de cautela enterprise más fuerte en el registro público. Son el mismo despliegue.

Las empresas que internalicen eso — que desplieguen agentes en L1 agresivamente, instrumenten el gate de juicio como un producto real, y resistan la tentación de publicar el número de ahorros antes de que el lag de satisfacción cierre — van a compoundar a través de 2026 y 2027. Las que desplieguen el anuncio de Klarna de 2024 sin leer la retractación de 2025 van a pasar 2027 reconstruyendo su capa humana al doble del costo.

¿Estás construyendo agentes para producción? El patrón Orchestrator-Worker y la observabilidad de sistemas multi-agente con OpenTelemetry son los siguientes pasos técnicos. Pero antes de eso, decide qué capa de juicio vas a automatizar — y qué capa vas a proteger.

Referencias rápidas

Vista general

Más en esta serie

Serie: Construyendo con IA: Lo que nadie te dice

// newsletter

¿Te sirvió este artículo?

Recibe los siguientes en tu inbox. Sin spam, cancela cuando quieras.

Discusión

Escrito por Jorge Ochoa. ¿Encontraste un error?

Abrir en GitHub