Project Glasswing: Cómo evaluar un modelo de IA antes de usarlo en la empresa
Cuando una empresa decide poner inteligencia artificial a cargo de un proceso sensible, la pregunta no debería terminar en qué herramienta va a usar. También importa qué modelo hay detrás, cómo fue evaluado y qué tan bien se comporta con los datos y casos reales de esa empresa.
Para un equipo de TI, esto se vuelve cada vez más difícil de responder. Los modelos cambian rápidamente, aparecen nuevas capacidades y los proveedores no siempre ofrecen acceso a los mismos modelos ni al mismo nivel de información sobre cómo funcionan. Un anuncio reciente de Anthropic muestra hasta qué punto puede llegar esa diferencia.

Project Glasswing, la escala de una auditoría que la mayoría de las empresas no puede replicar
En junio de 2026, Anthropic anunció que amplió Project Glasswing, su iniciativa para encontrar y corregir vulnerabilidades de seguridad en el software que sostiene infraestructura crítica, a unas 150 organizaciones nuevas repartidas en más de 15 países. El dato que debería llamar la atención de cualquier gerente de TI no es solo la cifra. Es que el modelo detrás de esa auditoría, llamado Claude Mythos Preview, no está disponible para el público. Ni siquiera está disponible para la mayoría de las empresas que hoy usan Claude en producción.
Project Glasswing partió en abril de 2026 con cerca de 50 organizaciones y socios de peso como Amazon Web Services, Apple, Cisco, CrowdStrike, Google, JPMorganChase, Microsoft, NVIDIA y Palo Alto Networks. Según la propia Anthropic, ese primer grupo encontró más de 10.000 fallas de severidad alta o crítica en sus bases de código usando Mythos Preview. La nueva expansión suma sectores que antes estaban poco representados, como energía, agua, salud, comunicaciones y hardware, además de proveedores cuyo software es usado por miles de otras organizaciones alrededor del mundo, incluyendo gobiernos.
Por qué Anthropic no libera Mythos Preview a todos
Anthropic es explícita sobre por qué mantiene Mythos Preview fuera del acceso general. La compañía advierte que dentro de 6 a 12 meses otros laboratorios probablemente tendrán modelos de capacidad similar en tareas de ciberseguridad, y que podrían lanzarlos sin las mismas salvaguardas. En otras palabras, el mismo modelo que hoy ayuda a proteger un hospital o una planta de energía podría, en las manos equivocadas, ayudar a atacarlo. Por eso la compañía avanza por etapas, ampliando el acceso solo a organizaciones que cumplen requisitos de seguridad específicos, mientras trabaja en salvaguardas que permitan una liberación más amplia en el futuro.

La lección para tu gerencia de TI, más allá de Mythos Preview
Para un gerente de TI o de seguridad que no trabaja en un banco global ni en una operadora eléctrica, esto puede parecer lejano. No lo es. La lección de fondo no tiene que ver con Mythos Preview en particular, sino con algo que toda empresa que ya usa o está por implementar IA necesita internalizar. No todos los modelos que existen están disponibles, no todos los que están disponibles son iguales, y la velocidad con la que cambia esta industria hace que evaluar un modelo antes de ponerlo en producción sea tan importante como evaluarlo después. Un modelo que hoy resuelve bien una tarea puede quedar obsoleto en meses, y uno nuevo puede traer capacidades o riesgos que la versión anterior no tenía.
Confiar un proceso sensible a un modelo, el caso del Auditor de Gastos
Ese criterio de evaluación es exactamente lo que está en juego cuando una empresa decide automatizar procesos sensibles con agentes de IA. El Auditor de Gastos Reembolsables de AgentLayer lee cada boleta, factura y recibo que entra a una empresa, los cruza contra la política interna y decide en segundos si un gasto se aprueba, pasa a revisión o se rechaza, sin muestreos ni excepciones. Ese tipo de agente procesa comprobantes financieros todos los días, detecta duplicados y patrones de fraude, y solo funciona si el modelo que lo sostiene es confiable de punta a punta. La pregunta que Project Glasswing pone sobre la mesa, qué tan seguro es el modelo que está a punto de quedar a cargo de datos sensibles, es la misma que cualquier empresa debería hacerse antes de automatizar auditoría, atención al cliente o ventas con IA.
Cómo AgentLayer decide si conviene migrar a un modelo nuevo
Esto no significa que cada empresa deba convertirse en experta en modelos fundacionales antes de adoptar un agente de IA. Significa que alguien tiene que hacer ese trabajo de evaluación de forma sistemática, y no cada vez que sale un modelo nuevo con mejor marketing. En AgentLayer, cada modelo nuevo que aparece en el mercado se revisa contra los agentes que ya están funcionando en producción, comparando desempeño, costo y comportamiento frente a los casos reales que hoy resuelven esos agentes, antes de decidir si conviene migrar. No se trata de correr detrás de cada lanzamiento, sino de tener un proceso que separe el entusiasmo por lo último de lo que efectivamente mejora un resultado de negocio.

La pregunta que realmente importa
La escala de Project Glasswing, con cientos de organizaciones y más de 10.000 vulnerabilidades ya identificadas, es una señal de hacia dónde va la industria, no solo en ciberseguridad sino en la forma en que se valida cualquier modelo antes de confiarle una tarea crítica. Para la gerencia de TI que hoy evalúa IA para su empresa, la pregunta relevante no es cuál es el modelo más nuevo o el más citado en la prensa. Es si alguien, dentro o fuera de la empresa, está haciendo el trabajo de verificar que ese modelo se comporte como corresponde antes de que toque un dato, un cliente o un proceso que realmente importa.