Associate AI Inference Engineer (m/f/d/x)
RemoteHamburg, Hamburg, GermanyentryFull-time
- Posted
- today
- Source
- LinkedIn (remote, Europe)
- Field
- Engineering
Skills
Machine LearningKubernetesOnboardingTerraformPythonDockerLinuxLLMsAI
Description
Über die Position
T-Systems baut Europas nächste Generation von KI-Infrastruktur mit der AI Industry Cloud auf, die von Tausenden NVIDIA-GPUs betrieben wird, darunter NVIDIA DGX B200- und B300-Systeme der neuesten Generation. Unsere Plattform ermöglicht es Unternehmen, modernste Large Language Models (LLMs) und Generative-AI-Anwendungen auf einer sicheren und hochperformanten Infrastruktur bereitzustellen, zu skalieren und zu betreiben.
Wir suchen einen Associate AI Inference Engineer zur Verstärkung unseres AI-Platform-Teams. In dieser Rolle unterstützt du die Bereitstellung, den Betrieb und die Optimierung produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform, die auf der Industrial AI Cloud betrieben wird. In enger Zusammenarbeit mit Plattform-Ingenieuren, AI Researchern und Softwareentwicklern trägst du dazu bei, hochperformante und zuverlässige KI-Services für Unternehmenskunden bereitzustellen.
Diese Position eignet sich insbesondere für Berufseinsteiger mit praktischer Erfahrung im Bereich LLM Inference, die mit moderner NVIDIA-GPU-Infrastruktur und produktiven KI-Systemen in großem Maßstab arbeiten möchten.
Aufgaben
- Bereitstellung, Konfiguration und Betrieb produktiver LLM-Inference-Services auf Basis der T-Systems AI Foundation Plattform.
- Optimierung von Inference-Workloads auf NVIDIA-GPU-Infrastruktur hinsichtlich Latenz, Durchsatz und GPU-Auslastung.
- Benchmarking und Evaluierung von LLM-Serving-Frameworks, Inference-Konfigurationen und Model Deployments.
- Implementierung und Optimierung moderner LLM-Serving-Techniken wie KV-Cache-Optimierung, Continuous Batching und Distributed Inference.
- Zusammenarbeit mit Plattform-Ingenieuren bei der Bereitstellung und Skalierung von AI-Workloads auf Kubernetes.
- Analyse und Behebung von Performance-Problemen im Inference-Betrieb über Software-, Netzwerk- und GPU-Infrastruktur hinweg.
- Mitwirkung bei der Automatisierung von Deployment-, Benchmarking- und Betriebsprozessen.
- Monitoring von Inference-Services mithilfe von Metriken, Logging und Dashboards zur Sicherstellung eines zuverlässigen Produktivbetriebs.
- Enge Zusammenarbeit mit AI Engineers und Researchern beim Onboarding neuer Foundation Models und Inference-Technologien.
- Pflege der technischen Dokumentation und Mitwirkung an der kontinuierlichen Weiterentwicklung der AI-Inference-Plattform.
Must-Have Skills
- Bachelorabschluss in Informatik, Elektrotechnik, Informationstechnologie oder einer vergleichbaren technischen Fachrichtung. Ein Masterabschluss in Künstlicher Intelligenz, Machine Learning oder einem verwandten Bereich ist von Vorteil.
- Relevante praktische Erfahrung in AI Engineering, Machine Learning Engineering oder AI Infrastructure Engineering, einschließlich Erfahrung als Werkstudent oder Research Engineer.
- Sehr gute Programmierkenntnisse in Python sowie Erfahrung in der Entwicklung von AI-Anwendungen und entsprechenden Tools.
- Praktische Erfahrung bei der Bereitstellung, dem Benchmarking oder der Optimierung von Large-Language-Model-(LLM)-Inference-Workloads.
- Praktische Erfahrung mit modernen LLM-Serving-Frameworks wie vLLM und SGLang.
- Praktische Erfahrung bei der Optimierung von LLM-Inference-Workloads auf NVIDIA-GPU-Infrastruktur sowie Berührungspunkte mit NVIDIA-DGX/HGX-Systemen oder GPU-Plattformen der nächsten Generation wie B200 und B300.
- Erfahrung mit der Evaluierung oder Optimierung fortgeschrittener Inference-Techniken wie KV Caching, Disaggregated Prefill/Decode Inference oder vergleichbaren LLM-Serving-Optimierungen.
- Kenntnisse moderner NVIDIA-Inference-Technologien wie NVIDIA Dynamo, LMCache, TensorRT-LLM, Triton Inference Server oder vergleichbarer GPU-Inference-Frameworks.
- Erfahrung im Benchmarking von AI-Modellen sowie in der Analyse von Inference-Performance, Latenz, Durchsatz und Serving-Effizienz.
- Erfahrung mit Docker, Kubernetes, Bash und Linux-basierten Compute-Umgebungen.
- Ausgeprägte analytische Fähigkeiten und Problemlösungskompetenz sowie die Fähigkeit zur Zusammenarbeit in multidisziplinären Engineering-Teams.
- Reisebereitschaft von bis zu 50 %.
- Internationale Erfahrung, beispielsweise durch Studium, Arbeit oder längere Auslandsaufenthalte.
Nice-to-Have Skills
- Kenntnisse in CUDA, NCCL, NVLink, GPUDirect RDMA oder InfiniBand Networking.
- Erfahrung im Betrieb produktiver AI-Services auf Kubernetes.
- Kenntnisse von Observability-Tools wie Prometheus, Grafana und OpenTelemetry.
- Erfahrung mit Helm, Terraform, GitHub Actions oder Infrastructure-as-Code.
- Erfahrung mit Enterprise-AI-Plattformen oder Multi-Tenant-Inference-Umgebungen.
- Kenntnisse im Bereich Retrieval-Augmented Generation (RAG), Vektordatenbanken oder Embedding-Retrieval-Systemen.
Was wir bieten
- Die Möglichkeit, an einer der größten Enterprise-AI-Plattformen Europas mitzuarbeiten.
- Arbeit mit modernster NVIDIA-AI-Infrastruktur, einschließlich DGX B200- und B300-Systemen.
- Praktische Erfahrung mit modernen LLM-Inference-Technologien, darunter AI Foundation, vLLM, SGLang, TensorRT-LLM, NVIDIA Dynamo und LMCache.
- Arbeit mit großen GPU-Clustern für Enterprise-AI-Workloads.
- Zusammenarbeit mit erfahrenen AI Researchern, Plattform-Ingenieuren und Softwareentwicklern.
- Möglichkeiten zur kontinuierlichen Weiterbildung sowie zur fachlichen und persönlichen Weiterentwicklung.
- Ein kollaboratives Arbeitsumfeld, in dem Innovation, technische Exzellenz und Wissensaustausch gefördert
Über T-Systems International GmbH
Bei T-Systems bieten wir unseren Geschäftskunden die richtigen Systemlösungen für ihr digitales Business. Mit unserem Portfolio stellen wir sicher, dass digitale Transformation Komplexität reduziert, Kosten einspart und die alltägliche Arbeit erleichtert. Unsere Schwerpunkte sind Konnektivität, Digital, Cloud & Infrastruktur sowie Sicherheit - Let's power higher performance!
Dieser Job ist wie für Sie gemacht? Dann nutzen Sie Ihre Chance! Bewerben Sie sich bitte online. Schwerbehinderte Menschen werden bei gleicher Eignung vorrangig berücksichtigt. Wir freuen uns auf Sie!
None None
JobMatch aggregates public listings. Always apply through the original posting.