L
Posted 1mo agoGangseo-gu, Seoul, South Korea

LLM Inference Engineer

MiddleOn-site (Gangseo)Salary undisclosed
Required Skills
PythonPyTorchTensorFlowLLMs
Job Description

팀 소개

Platform&Infra Team은 AI모델의 개발부터 서비스 운영을 위한 배포에 이르기까지 AI모델의 수명 주기를 최적화하고, 효율적으로 관리하기 위한 MLOps 파이프라인을 구축합니다. 또한 AI서비스의 안정적인 운영 지원을 위한 보안성 강화, 인프라 관리 및 자원 최적화 업무를 수행합니다.
팀 내에서 LLM Inference Engineer는 대규모 언어 모델(LLM)의 추론 성능을 최적화하고, 다양한 프레임워크에서 EXAONE모델을 안정적으로 서빙할 수 있는 엔진을 개발합니다. 또한, 오픈소스 프로젝트의 공식 채널을 통해 요청되는 기능 개선, 버그 수정, 성능 최적화 등의 요건에 대응하며, 다양한 환경에서 LLM이 안정적으로 동작할 수 있도록 기여합니다.

수행 업무

  • LLM 추론 성능 최적화: 대규모 언어 모델(LLM)의 추론 성능을 극대화하기 위한 개선 방안을 도출하고 설계에 참여합니다.
  • 서빙 엔진 개발: 다양한 프레임워크 상에서 엑사원 모델을 안정적으로 서빙할 수 있는 엔진을 개발합니다.
  • 오픈소스 기여: 오픈소스 LLM 서빙 프레임워크(vLLM, SGLang, Ollama 등)의 공식 채널을 통해 요청되는 기능 개선, 버그 수정, 성능 최적화 등의 요건에 대응하고 기여합니다.
  • 다양한 환경 지원: chat_template을 활용하여 다양한 언어와 환경에서 LLM이 올바르게 동작할 수 있도록 적용하고 개선합니다.
  • 모델 추론 가속화: NPU/GPU 기반의 Serving 전략을 설계하고, 모델 추론 가속화 알고리즘을 연구 및 구현합니다.

Similar Openings in AI & Machine Learning

View all in category