Skip to content
← Back to job listings

Lead LLM Engineer

Licorne Society · Paris, Ile-de-France, France

External listingfull-timeabout 2 months ago

About The Role

Rejoignez une startup IA en pleine croissance en tant que Lead LLM Engineer. Vous serez responsable de la conception et de l'évolution de l'architecture LLM/agent, de la qualité de sortie dans des cas d'utilisation clés, de la construction de systèmes d'évaluation, de l'itération rapide à partir des données de production, de l'amélioration de la récupération, du raisonnement et de l'utilisation des outils, de la fiabilité de la production et de la collaboration directe avec le produit et les fondateurs.

  • Concevoir et faire évoluer l'architecture LLM / agent, en veillant à la qualité des sorties.
  • Construire des systèmes d'évaluation (ensembles de données, métriques, détection de régression) et diriger des boucles d'itération rapides.
  • Améliorer la récupération, le raisonnement et l'utilisation des outils, et garantir la fiabilité de la production.

Licorne Society a été missionné par une startup IA en pleine croissance pour les aider à trouver leur Lead LLM Engineer.
## **What you will own**

You will be responsible for one thing

**Make our AI outputs reliable, fast, and indispensable in real workflows.**

Concretely

  • Design and evolve our **LLM / agent architecture**
  • Own **output quality across key use cases** (emails, document analysis, etc.)
  • Build **evaluation systems** (datasets, metrics, regression detection)
  • Drive **fast iteration loops** from production data
  • Improve **retrieval, reasoning, and tool usage**
  • Ensure **production reliability** (latency, failure modes, fallback)
  • Work directly with product + founders on **what to build and why**

## **What this role is really about**

Most teams fail because

  • they don’t know what “good output” means
  • they don’t have evals
  • they iterate randomly
  • they overuse agents

Your job is to fix that.

You will turn

  • vague user problems
  • → into structured AI systems
  • → with measurable performance
  • → that improve every week

## **What you need to be excellent at**
### **1. Shipping real LLM systems**

  • You’ve built systems used in production (not demos)
  • You understand **RAG, tools, agents, structured outputs**
  • You can design full pipelines, not just prompts

### **2. Evaluation-driven development**

  • You know how to define **quality metrics**
  • You build **datasets from real usage**
  • You run **continuous evals to prevent regressions**

### **3. Debugging complex failures**

  • You can trace issues across:
  • retrieval
  • prompts
  • model behavior
  • You don’t guess — you isolate and fix

### **4. Speed of iteration**

  • You move from problem → improvement in **hours or days, not weeks**
  • You use logs, traces, and data — not intuition alone

### **5. Strong judgment**

  • You know when to:
  • use an agent vs a pipeline
  • add complexity vs simplify
  • You optimize for **reliability and user value**, not novelty

## **What we don’t care about**

  • Number of years of experience
  • Whether you’ve used a specific framework
  • Fancy research credentials

If you can **build, debug, and improve real systems**, you’re a fit.
## **What success looks like (first 90 days)**

  • Clear **eval framework** for core use cases
  • Measurable improvement in **output quality**
  • Faster **iteration cycles** across the team
  • Reduced **hallucinations / failures**
  • Stronger **system architecture decisions**

## **Stack (context, not requirements)**

  • Python (FastAPI)
  • Postgres
  • Google Cloud
  • LangGraph / LangChain (evolving)
  • PostHog (product analytics)
  • Langfuse (LLM traces)
  • LLM APIs (Azure OpenAI)

This is an external listing. JobSpring does not represent or verify the employer. Report this listing