KarminaAI StudioAgents · Serveis · Formació

JOBS · Col·laboració per projecte

AI Evals & Reliability Engineer

Dissenya proves per entendre quan un agent és fiable, quan falla i com ha de millorar.

L’oportunitat

Converteix «sembla que funciona» en evidència.

Busquem un perfil d’AI Evals & Reliability Engineer per dissenyar la capa de proves d’agents i aplicacions generatives. Volem mesurar comportament, qualitat, seguretat, cost i latència amb casos representatius abans de confiar en una demo o en una impressió subjectiva.

Àrea
Qualitat i fiabilitat
Experiència
3+ anys
Modalitat
Remot
Col·laboració
Per projecte o recurrent

Què busquem?

  • Experiència creant datasets de prova, criteris d’acceptació i suites de regressió.
  • Coneixement d’avaluació determinista, similitud, classificació, graders basats en models i revisió humana.
  • Capacitat per analitzar traces, tool calls, recuperacions i resultats finals.
  • Experiència amb Python, anàlisi de dades i automatització de proves.
  • Criteri per distingir mètriques útils de puntuacions que no reflecteixen el procés real.
  • Capacitat per comunicar fallades i trade-offs de manera comprensible.

Què faràs?

  • Convertir requisits de negoci i riscos en casos de prova.
  • Construir bancs d’exemples correctes, incorrectes, ambigus i adversarials.
  • Dissenyar evals de resposta, retrieval, tool use, handoffs i compliment de límits.
  • Analitzar regressions quan canvien el model, el prompt, les fonts o les eines.
  • Mesurar cost, latència, taxa d’escalat, falsos positius i esforç de revisió humana.
  • Preparar dashboards i informes per decidir si un pilot avança, es corregeix o s’atura.
  • Coordinar proves amb especialistes de domini i responsables del procés.

Ens impressionarà especialment

  • Una suite que hagi descobert un error important abans de producció.
  • Experiència amb red teaming, observabilitat de LLM, avaluació de RAG o proves d’agents amb eines.
  • Saber quan una mètrica automàtica necessita una mostra humana ben dissenyada.

Què trobaràs?

L’avaluació no serà una fase final: participarà des del blueprint i acompanyarà cada canvi rellevant. Tindràs autoritat per demostrar que una millora aparent no supera el conjunt de proves.

Com presentar-t’hi

Adjunta el teu CV i, si vols, un únic enllaç a un GitHub, un framework d’avaluació, un test plan o un dashboard anonimitzat.

Talent

AI Evals & Reliability Engineer

Aquesta és la via per presentar una candidatura o proposar una col·laboració professional. Tots els camps són opcionals. Les consultes de projectes i serveis es gestionen a hello@karmina.ai.

jobs@agenciakarmina.com