Stiamo sviluppando una piattaforma di Intelligenza Artificiale generativa basata su modelli LLM open-weight eseguiti su infrastruttura proprietaria.
Cerchiamo un LLM Systems Engineer che progetti e realizzi l’infrastruttura AI alla base della piattaforma.
Responsabilità
Deploy e gestione di modelli LLM open-weight
Progettazione dell’architettura di inferenza
Sviluppo dell’infrastruttura di serving ad alte prestazioni
Implementazione di sistemi di memoria e orchestrazione
Ottimizzazione di latenza, throughput e utilizzo delle GPU
Sviluppo di pipeline di valutazione e monitoraggio
Requisiti
Esperienza concreta con la maggior parte delle seguenti tecnologie:
Python
FastAPI
Docker
Kubernetes
PostgreSQL
Redis
vLLM,
SGLang o TensorRT-LLM
llama.cpp
Hugging Face Transformers
CUDA
Quantizzazione e ottimizzazione dell’inferenza su GPU
È richiesta esperienza nella messa in produzione di sistemi basati su LLM.
Costituiscono titolo preferenziale
Inferenza multi-GPU
Architetture ad agenti
Sistemi di memoria persistente
Contributi a progetti open source
Mostra le tue capacità professionali all'azienda, compila il form e lascia un tocco personale nella lettera di presentazione, aiuterà il recruiter nella scelta del candidato.