This post is not translated yet. The Korean original is shown below — read it in Korean.
“MLOps 뽑는다”는 말만 보고 지원하면 면접장에서 엇갈린다. 어떤 곳은 CUDA 커널을 묻고, 어떤 곳은 쿠버네티스 스케줄러를 묻고, 어떤 곳은 랙당 전력을 묻는다. 직무명은 같은데 일이 다르다.
그래서 공고를 직접 열어봤다. 남이 정리한 목록이 아니라 회사가 자기 입으로 쓴 문장을 읽는 게 빠르다.
세는 방법
기업들이 공개해둔 채용 창구에서 공고 전문을 그대로 받았다. 2026년 9월 12일 기준이다.
| 회사 | 창구 | 전체 공고 | 해당 직무 |
|---|---|---|---|
| 카카오 | careers.kakao.com 공개 API | 기술직 33건 | 1건 |
| 크래프톤 | Greenhouse 공개 보드 | 63건 | 1건 |
| LG AI연구원 | lgresearch.ai 채용 | — | 1건 |
| 쿠팡 | Greenhouse 공개 보드 | 692건(한국 357건) | 2건 |
| 네이버 | recruit.navercorp.com | 45건 | 0건 |
| 네이버클라우드 | recruit.navercloudcorp.com | 6건 | 0건 |
| 우아한형제들 | career.woowahan.com | 53건 | 0건 |
삼성·SK는 채용 보드가 화면을 그린 뒤에야 목록을 불러오는 구조라 공개 창구로는 확인하지 못했다. 없다는 뜻이 아니라 이 방법으로는 못 셌다는 뜻이다. SK키파운드리의 AI Platform Engineer 공고는 찾았지만 접수가 6월 17일에 끝났다.
먼저 용어: MLOps 와 LLMOps 는 뭐가 다른가
MLOps는 머신러닝 모델을 만들고 서비스에 올려 계속 돌아가게 만드는 일 전체다. 모델을 학습시키고, 성능을 재고, 서버에 배포하고, 망가지면 되돌린다. 10년 가까이 된 말이다.
LLMOps는 그중 거대 언어모델에만 생기는 문제를 따로 떼어낸 말이다. 왜 따로 떼어냈을까. 숫자가 다르기 때문이다.
예전 모델은 한 대의 GPU에 올라갔다. 요청이 오면 0.01초 안에 답이 나왔다. 지금 LLM은 여러 장의 GPU에 쪼개 올려야 들어가고, 답이 한 번에 나오지 않고 글자 단위로 흘러나온다. 그래서 재는 지표 자체가 바뀐다.
- TTFT(Time To First Token): 첫 글자가 나오기까지 걸린 시간. 사용자가 “멈췄나?” 하고 느끼는 구간이다.
- TPOT(Time Per Output Token): 그다음 글자들이 나오는 속도. 글이 타이핑되듯 흐르는 느낌을 결정한다.
이 두 숫자는 서로 싸운다. 요청을 많이 묶어 한꺼번에 처리하면 전체 처리량은 늘지만 첫 글자가 늦게 나온다. 그 균형을 잡는 게 LLMOps 하는 사람의 일이다. 아래 카카오 공고에 이 단어들이 그대로 나온다.
카카오: 추론 엔진을 깎는다
공고 이름은 AI Platform 추론 최적화 Engineer(경력)다. AI플랫폼팀 소속이고, 공고는 팀을 이렇게 소개한다.
“Kakao AI Platform(이하 KAP)을 만들어 수천 장 규모의 GPU 클러스터 위에서 추론 서비스의 효율적이고 안정적인 서빙을 책임지고 있습니다.”
주목할 문장이 하나 더 있다.
“MLOps/LLMOps의 역할을 담당하며 전통적인 ML 워크로드부터 오픈소스 LLM, kanana 모델까지 카카오 내 AI 서비스들의 배포와 운영을 효율화하는 것을 핵심 미션으로 삼고 있습니다.”
MLOps와 LLMOps를 한 직무로 묶어 정의했다. 국내 공고 중 이렇게 명시한 경우는 드물다. kanana는 카카오가 직접 만든 언어모델이다. 남의 모델만 가져다 쓰는 게 아니라 자기 모델도 같이 돌린다는 뜻이다.
하는 일은 이렇게 적혀 있다.
- vLLM, SGLang, TensorRT-LLM 등 오픈소스 추론 엔진의 도입, 적용 및 운영
- LLM 추론 성능 향상을 위한 캐시, 배칭, 양자화, 커널 최적화
- 분산 추론 전략 설계 및 구현 (Tensor / Pipeline / Expert / Sequence Parallelism, MoE 라우팅)
- latency, throughput, TTFT, TPOT 등 성능 지표 측정 및 개선
- 쿠버네티스 기반 LLM 서빙 인프라 구축·운영·자동화
- 라우팅·오토스케일링·로드밸런싱·요청 스케줄링
낯선 말들을 풀어보자.
추론 엔진은 모델을 실제로 돌려주는 프로그램이다. vLLM이 대표적이다. 같은 모델, 같은 GPU여도 엔진을 바꾸면 처리량이 몇 배 달라진다. 그래서 엔진을 고르고 설정을 맞추는 일이 따로 존재한다.
양자화는 모델의 숫자를 더 거친 단위로 바꿔 크기를 줄이는 것이다. 소수점을 덜 쓰는 셈이다. 메모리가 줄고 속도가 빨라지는 대신 답의 품질이 조금 떨어진다. 어디까지 줄일지가 판단이다.
분산 추론은 모델 한 개를 여러 GPU에 쪼개 올리는 방식이다. 쪼개는 방향이 여러 가지라 이름이 따로 있다. 층을 나눠 담으면 Pipeline, 한 층을 가로로 쪼개면 Tensor다. MoE 라우팅은 모델 안에 전문가 여러 명을 두고 질문마다 필요한 사람만 깨우는 구조에서, 누구를 깨울지 고르는 부분이다.
특이점. 이 공고는 채용 페이지에 자기 팀 발표 영상 링크를 붙여뒀다. IF KAKAO 2024의 KAP 소개, 2025의 GenAI Gateway 세션이다. 공고만으로 판단하지 말고 그 발표를 보라는 뜻이다. 지원 전에 보고 가면 면접에서 할 말이 생긴다.
크래프톤: 게임사가 GPU 클러스터를 직접 굴린다
공고 이름은 [AI Research Div.] ML Infrastructure Engineer (5년 이상)다. 팀 이름은 KRAFTON MLSys & Ops. 공고에 장비가 숫자로 적혀 있다.
“이번 포지션은 이미 확보된 B300 125노드 기반 GPU Infrastructure를 함께 운영·고도화하면서, 이를 연구·개발 조직이 안정적이고 효율적으로 활용할 수 있는 GPU Platform으로 발전시키는 실무형 시니어 엔지니어 역할입니다.”
B300은 엔비디아의 최신 학습용 GPU다. 공고는 노드 수만 적었는데, 한 노드에 8장을 싣는 구성이 일반적이므로 그 기준이면 1,000장 규모다. 배틀그라운드를 만든 회사가 이걸 직접 사서 직접 굴린다.
하는 일은 학습 쪽에 무게가 있다.
- B300 125노드 인프라의 운영 안정화, 성능 개선, 자원 효율화, 운영 자동화
- 쿠버네티스 기반 ML/GPU Platform의 스케줄링, 멀티테넌시, 워크로드 격리, Quota, 관측성, 장애 대응
- GPU 활용률, 대기 시간, 처리량, 비용 효율을 개선하는 운영 전략 수립
멀티테넌시는 한 클러스터를 여러 팀이 나눠 쓰게 만드는 것이다. Quota는 각 팀에 GPU를 몇 장까지 허용할지 정해두는 몫이다. 이게 왜 어려울까. GPU는 비싸고 수가 정해져 있는데 연구자는 전부 “지금 당장” 필요하다고 말한다. 누가 먼저 쓰고 누가 기다릴지를 사람이 조율하지 않고 시스템이 정하게 만드는 일이다.
특이점. 필수요건에 이런 문장이 있다.
“완벽하게 모든 경험을 갖춘 분보다는, AI/ML 인프라의 특정 영역을 깊이 있게 다루며 확실한 전문성과 문제 해결 경험을 쌓아온 분을 찾습니다.”
공고 요건을 전부 만족해야 한다고 생각해 지원을 접는 사람이 많다. 이 회사는 반대를 적어뒀다. 넓게 얕은 사람보다 한 군데 깊은 사람을 찾는다고.
LG AI연구원: 모델의 처음부터 끝까지
공고 이름은 MLOps Engineer, 팀은 Platform&Infra팀이다. 앞의 두 곳과 범위가 다르다. 카카오는 추론, 크래프톤은 학습 쪽에 치우쳐 있는데 여기는 수명주기 전체를 본다.
하는 일이다.
- AI 모델 학습/추론을 위한 플랫폼을 설계하고 개발
- 학습, 추론, 모니터링이 포함된 Container-native Workflow 개발·운영
- 쿠버네티스 환경에서 마이크로서비스 구조 기반 서비스 개발·운영
- 다양한 도메인의 ML/DL 모델을 최적화하고 서비스 환경에 맞게 배포·운영
자격요건에는 도구 이름이 구체적이다. Git·Docker·쿠버네티스, CI/CD는 Helm·Kustomize·ArgoCD, 백엔드는 Python 또는 Go, 그리고 퍼블릭 클라우드의 AI/ML 서비스 경험.
ArgoCD는 설명이 필요하다. 깃 저장소에 적힌 내용을 그대로 실제 서버 상태로 맞춰주는 도구다. 배포를 손으로 하지 않고 “저장소를 고치면 반영된다”로 바꾼다. 잘못되면 되돌리기도 쉽다. 요즘 쿠버네티스를 쓰는 곳에서 거의 기본으로 깔린다.
특이점. 팀 설명에 모델 운영과 함께 보안성 강화가 같이 들어 있다. 모델 수명주기 최적화, 안정적 운영 지원을 위한 보안 강화, 인프라 관리, 자원 최적화가 한 팀 몫이다. 엑사원을 그룹사 여러 곳에 공급하는 구조라 그렇게 묶였을 가능성이 크다. 내 서비스 하나만 보는 게 아니라 남의 회사에 넘길 물건을 운영하는 일에 가깝다.
쿠팡: 소프트웨어가 아니라 건물을 뽑는다
쿠팡의 한국 공고 357건 중 이 주제에 걸리는 건 두 건인데, 한 건이 특이하다. Sr. Staff - AI Data Center Architect다.
“전통적인 코로케이션 모델에서 고밀도 AI Factory로 전환하는 차세대 데이터센터의 설계 방향을 이끈다. 우리의 ‘화이트 스페이스’가 100kW 이상의 랙, 칩 직접 냉각(liquid-to-chip), 800G/1.6T 네트워킹의 처리량 요구를 감당할 수 있게 만드는 물리적·논리적 설계도를 책임진다.”
번역하면, 남의 데이터센터를 빌려 쓰던 걸 그만두고 직접 짓는다는 뜻이다.
- 코로케이션은 남이 지은 건물에 내 서버만 넣는 방식이다. 지금까지 쿠팡이 해온 방식이다.
- 화이트 스페이스는 데이터센터에서 실제로 서버 랙이 서는 공간이다.
- 100kW 랙은 숫자를 보면 감이 온다. 일반 사무용 서버 랙은 5~10kW다. 가정용 에어컨 한 대가 2kW쯤이다. 랙 하나가 에어컨 50대 분량의 전기를 먹고, 그만큼의 열을 뱉는다.
- 그래서 칩 직접 냉각이 나온다. 공기로는 못 식힌다. 액체를 칩까지 끌어와 직접 닿게 한다. 공고는 공랭에서 하이브리드 냉각으로 넘어가는 설계를 맡긴다고 적고 있다.
다른 한 건은 Staff Backend Engineer (Streaming & AI Infrastructure)인데, 여기는 숫자가 이렇게 적혀 있다. 초당 10만 건 이상의 이벤트를 1초 미만 지연으로 처리하고, 99.9999% 가용성을 지키면서 스트림 처리 경로에 AI/ML 모델을 직접 끼워넣는 일이다.
특이점. 쿠팡은 이 주제에서 가장 아래 층을 뽑고 있다. 모델이나 서빙이 아니라 전력·냉각·네트워크다. 그리고 사내 클라우드를 Coupang Intelligent Cloud라는 이름으로 부르는 공고가 따로 있다. 커머스 회사가 자기 클라우드를 만들고 있다는 뜻이다.
네이버: 왜 한 건도 없을까
확인해야 할 게 남았다. 하이퍼클로바X를 만든 회사가 이 목록에 없다.
없는 게 맞았다. 네이버 본사 채용 보드의 공고는 45건인데 ‘MLOps’, ‘LLM’, ‘머신러닝’으로 검색하면 0건이다. ‘AI’로 검색하면 4건 나오는데 상품 기획, 대외정책, 웹툰 인턴, 그리고 네이버랩스의 3D 비전 연구 직무다. 네이버클라우드 보드는 6건이고, 사업개발·세일즈·HR·상품기획뿐이다. 엔지니어 공고가 아예 없다.
해석은 조심해야 한다. 공개 보드에 없다는 것이 사람을 안 뽑는다는 뜻은 아니다. 수시채용과 추천(리퍼럴)으로만 돌리는 조직이 있고, 계열사별 별도 창구를 쓰기도 한다. 다만 공개적으로 확인할 수 있는 범위에서는 0건이다.
우아한형제들도 비슷하다. 53건 중 데이터 엔지니어링 두 건이 있고 MLOps는 없다.
여기서 읽을 수 있는 건 하나다. “대기업이니까 당연히 뽑겠지”가 틀릴 수 있다. 지원할 회사를 정할 때 회사 이름이 아니라 지금 열린 공고를 봐야 한다.
한 장으로 정리
| 회사 | 직무명 | 팀 | 무게중심 | 특이점 |
|---|---|---|---|---|
| 카카오 | AI Platform 추론 최적화 Engineer | AI플랫폼팀 | 추론 | MLOps/LLMOps를 한 직무로 정의. 자기 모델(kanana) 운영 |
| 크래프톤 | ML Infrastructure Engineer | MLSys & Ops | 학습 인프라 | B300 125노드 직접 보유. “넓게”보다 “깊게”를 요구 |
| LG AI연구원 | MLOps Engineer | Platform&Infra | 수명주기 전체 | 운영과 보안이 한 팀. 그룹사 공급 구조 |
| 쿠팡 | AI Data Center Architect | — | 전력·냉각 | 코로케이션 탈출. 100kW 랙, 칩 직접 냉각 |
| 네이버 | — | — | — | 공개 보드 0건 |
준비하는 사람에게
네 회사의 요구가 갈라지는데도 겹치는 게 셋 있다.
첫째, 쿠버네티스. 네 공고 모두에 나온다. 예외가 없었다. 다만 깊이가 다르다. LG는 “환경에서 서비스를 운영”하는 수준이고, 크래프톤은 스케줄링과 워크로드 격리를 직접 고치는 수준이다. 어느 쪽을 노릴지에 따라 공부 범위가 달라진다.
둘째, 관측성. 크래프톤은 “관측성 체계”, 카카오는 “성능 지표 측정 및 개선”, LG는 “모니터링이 포함된 워크플로”라고 쓴다. 말은 다르지만 같은 요구다. 문제가 생겼을 때 어디가 막혔는지 숫자로 짚을 수 있느냐. GPU를 다뤄본 적이 없어도 이건 지금 하는 일에서 연습할 수 있다.
셋째, 비용. 크래프톤은 “비용 효율”, 카카오는 “효율적인 서빙”, 쿠팡은 랙당 전력을 말한다. GPU가 비싸서 그렇다. 같은 장비로 더 많이 돌리는 방법을 아는 사람이 값을 받는다.
반대로, 처음부터 전부 갖출 필요는 없다는 증거도 공고 안에 있다. 크래프톤이 직접 적었다. 한 영역을 깊게 판 사람을 찾는다고.
시작점을 하나 고르라면 관측성을 권한다. 장비가 없어도 연습되고, 네 회사가 전부 요구하며, 지금 맡은 서비스에서 바로 써먹을 수 있다. 추론 엔진이나 랙 전력은 그 장비를 만진 다음에 오는 이야기다.
공고 내용은 2026년 9월 12일에 각 회사 공개 채용 창구에서 직접 받은 것이다. 채용공고는 수시로 닫히므로 지원 전 원문을 다시 확인할 것.

Leave a Reply