Orientación laboral con IA, responsable ante la evidencia

Rol: Diseñé y construí la base compartida de IA y el prototipo de orientación laboral · 2026 · unlaunched POC

Publiqué la infraestructura compartida de seguridad del portafolio de IA aplicada de MyCareer.NJ.gov y después construí un prototipo de orientación laboral que no se lanzó. Las pruebas ejecutadas mejoraron con fuerza y aún revelaron vacíos que bloqueaban un piloto.

Límite de evidencia

Construido
Controles compartidos de Bedrock y un prototipo bilingüe fundamentado de orientación laboral
Observado
200 conversaciones y 810 turnos en pruebas ejecutadas; 84 % de aprobación por conversación y 96 % por turno
No demostrado
Preparación para piloto, uso por residentes, resultados de empleo o capacitación, ni valor público

Medidas seleccionadas

infraestructura compartida de seguridad en Bedrock integrada y activa en producción
Shipped
conversaciones / turnos en la última prueba ejecutada con Bedrock
200 / 810
aprobación por conversación / turno; mejora, no preparación para piloto
84% / 96%
casos adversarios bilingües que bloqueaban la integración
~79
enlaces ocupacionales sin códigos SOC inventados después de corregir la fundamentación
26 / 26
personas residentes usuarias, pilotos publicados o resultados atribuidos
0
Registro de publicación que separa la infraestructura compartida de seguridad en Bedrock que llegó a producción del orientador laboral para residentes que quedó detrás de una puerta de piloto. Las pruebas mejoraron de 36 a 84 por ciento de aprobación por conversación y aún no establecieron preparación.

Es fácil confundir dos artefactos distintos en una sola afirmación sobre IA. Diseñé de forma independiente y publiqué una capa compartida de seguridad en Bedrock (se abre en una pestaña nueva) dentro del código de producción de MyCareer.NJ.gov (se abre en una pestaña nueva). También diseñé y construí sobre ella el mayor prototipo orientado a residentes: un orientador laboral fundamentado. Ese orientador no se integró, permaneció detrás de banderas desactivadas y requería aprobación de piloto. Ninguna persona residente lo usó y no le atribuyo ningún resultado de empleo o capacitación.

Lo que sí se publicó

La base de producción incluye un cliente reutilizable de Bedrock, cortacircuitos, límites de entrada, catorce categorías nombradas de patrones de inyección (se abre en una pestaña nueva), análisis seguro de salidas malformadas, identificadores de modelo fijados, banderas por función, un interruptor maestro y límites de módulos aplicados automáticamente. La capa compartida en TypeScript tenía 761 líneas de pruebas en cinco archivos; un cliente separado en Python con su propio cortacircuitos y límite de entrada también llegó a la rama principal de Career Navigator. Publicar primero el plano de control permitió que los experimentos heredaran un mecanismo común para detenerse.

Lo que quedó detrás de la puerta de piloto

El orientador no lanzado era un sistema RAG bilingüe sobre datos aprobados de Nueva Jersey: capacitación, ocupaciones, salarios, financiación, rutas y servicios de apoyo (se abre en una pestaña nueva). Un clasificador de intención enviaba preguntas sobre capacitación, financiación, brechas de habilidades, recursos de crisis y reinserción a rutas de consulta distintas. Más de treinta herramientas aportaban contexto estructurado. Las consultas simples iban a Claude Haiku y la orientación genuina a Claude Sonnet, conservando una diferencia deliberada de costo cercana a doce veces. Se diseñaron streaming, contexto de página, controles de sesión, límites de tokens e interruptor mensual; ambas banderas para residentes quedaron apagadas.

La fundamentación tenía que sobrevivir a los identificadores

Un defecto real volvió concreta la lección de fundamentación: una respuesta podía nombrar la ocupación correcta y aun así construir un enlace SOC (se abre en una pestaña nueva) equivocado. Cambié el contrato de contexto para que cada referencia llegara como un par exacto y copiable Título (SOC) y añadí una comprobación de salida que degradaba enlaces no respaldados por el contexto recuperado. En cuatro ejecuciones después de la corrección, los 26 enlaces ocupacionales usaron identificadores suministrados y ninguno inventó un código SOC. La regla duradera fue arquitectónica: proporcionar identificadores, nunca pedir al modelo que los infiera.

El sistema de evaluación era mayor que una sola puntuación

El prototipo abarcaba aproximadamente 191 archivos, 47.500 líneas añadidas y 34 archivos de pruebas. Su puerta de seguridad cubría unos 79 casos adversarios bilingües —anulación de instrucciones, manipulación de roles, jailbreaks, filtración de prompts, ejecución de código y ofuscación— más una lista permitida de 19 mensajes legítimos para detectar rechazos excesivos. Un conjunto de 210 respuestas conocidas, un plan enumerado de 306 pruebas unitarias y un arnés de 390 conversaciones cubrían prompts, matrices, fundamentación, crisis, rechazo y sesgo. Son activos de prueba diseñados. Las ejecuciones reales con Bedrock que siguen son la evidencia de tiempo de ejecución; la distinción importa.

Las pruebas ejecutadas cambiaron la decisión de publicación

La base del 15 de mayo de 2026 ejecutó 50 conversaciones y 202 turnos: aprobaron el 36 por ciento de las conversaciones y el 89 por ciento de los turnos, con respuestas vacías, enlaces de programas faltantes y solo 3 por ciento de retención media de contexto. Para el 29 de mayo, la ejecución cubrió 200 conversaciones y 810 turnos; aprobaron 168 conversaciones y 780 turnos, es decir 84 y 96 por ciento. Es una mejora de ingeniería significativa. No equivale a estar listo para publicar.

Lo que todavía bloqueaba un piloto

La última ejecución aún obtuvo 70 por ciento en situaciones de vida, 60 por ciento en comparaciones, 40 por ciento en contexto de página y 45 por ciento de retención media; registró 22 enlaces de programas faltantes y ocho problemas de baja pertinencia. Español obtuvo 100 por ciento en la categoría automatizada, pero exigía revisión humana antes de cualquier afirmación pública. Ocho puertas de preparación definían bloqueos para calidad, fundamentación, rutas de alto riesgo en inglés y español, privacidad, costo, confiabilidad, accesibilidad y operaciones. Se completaron seis auditorías previas. Las puertas sin resolver —no el mejor número agregado— controlaron la decisión.

Una base, diecinueve experimentos

La capa compartida sostuvo seis prototipos principales y trece secundarios. Los principales cubrían el orientador, búsqueda semántica, comparación de currículum y habilidades, inteligencia laboral predictiva, notificaciones y automatización de contenido y accesibilidad. Los secundarios exploraban credenciales acumulables, rutas de aprendizaje, vigencia de datos, salud de programas, narrativas laborales, equidad regional, datos abiertos, tendencias de inscripción y métricas de resultados. Es amplitud de portafolio, no diecinueve productos publicados: las funciones seguían abiertas o en borrador pendientes de piloto.

Una comparación limitada, no una afirmación de novedad

Un análisis de los cincuenta estados no encontró entonces un orientador conversacional equivalente para residentes y fundamentado en registros estatales de programas. El hallazgo ayudó a orientar el trabajo; no demuestra que no existiera un sistema comparable, que permaneciera sin publicar o que apareciera después.

Este prototipo solo se entiende sobre el sistema estatal de datos y entrega descrito en el caso de estudio de la plataforma MyCareer.NJ.gov. La afirmación conjunta correcta es precisa: la plataforma atendió a residentes y publicó evidencia de programas; las salvaguardas compartidas de IA se publicaron; el orientador laboral no.

  • AI
  • Responsible AI
  • Workforce
  • Proof of concept