←기록

ChatGPT Share Archive

일리야와 안드레이 비교

공유된 ChatGPT 대화를 읽기 쉬운 정적 문서로 옮긴 보관 페이지입니다. 긴 표와 코드 블록은 원문 구조를 유지하면서 작은 화면에서도 넘치지 않게 정리했습니다.

메시지 22개 한국어 대화 원본 공유 링크
사용자 #01

일리야 슈츠케바와 안드레 카파시 두사람 비교해줘
학력 경력 나이 등

ChatGPT #02

둘은 자주 함께 언급되지만 성격이 꽤 다른 AI 연구자입니다. 일리야 수츠케버(Ilya Sutskever)는 ‘AI의 근본 연구·스케일링·AGI’ 쪽, 안드레이 카파시(Andrej Karpathy)는 ‘딥러닝을 실제 시스템으로 구현하고 설명하는 능력’ 쪽이 특히 강하다고 보면 이해가 쉽습니다.

항목일리야 수츠케버안드레이 카파시
출생1986년 전후, 러시아 출생1986년, 당시 체코슬로바키아 브라티슬라바 출생
나이2026년 기준 약 39~40세2026년 기준 39세
성장러시아 → 이스라엘 → 캐나다슬로바키아 → 캐나다
학부토론토대 수학 BSc, 2005토론토대 컴퓨터과학+물리학 복수전공, 수학 부전공, 2009
석사토론토대 컴퓨터과학, 2007브리티시컬럼비아대(UBC) 컴퓨터과학, 2011
박사토론토대 컴퓨터과학스탠퍼드대 컴퓨터과학
박사 지도교수Geoffrey HintonFei-Fei Li
초기 전문신경망, 표현학습, 시퀀스 모델컴퓨터비전, CNN/RNN, vision-language
대표 업적AlexNet, Seq2Seq, Google Brain, OpenAICS231n, OpenAI, Tesla Autopilot AI
OpenAI공동창업자·Chief Scientist초기 founding member·연구과학자, 이후 재합류
Tesla없음AI Director, Autopilot 비전팀 총괄
현재Safe Superintelligence(SSI) 공동창업자·CEOEureka Labs 창업, AI 교육·연구 활동
이미지‘연구자의 연구자’‘연구자 + 엔지니어 + 교육자’

1. 학력은 둘 다 토론토대에서 시작했습니다

흥미로운 점은 두 사람 모두 University of Toronto 출신이라는 겁니다.

수츠케버는 고등학교 과정을 다 마치기도 전에 토론토대 수학과에 진학했고, 2005년 수학 학사를 받은 뒤 컴퓨터과학 석사와 박사까지 토론토대에서 했습니다. 특히 현대 딥러닝의 핵심 인물인 제프리 힌턴(Geoffrey Hinton)의 제자였습니다. 출처

카파시는 토론토대에서 컴퓨터과학과 물리학 복수전공 + 수학 부전공을 했습니다. 이후 UBC에서 석사를 하고, 스탠퍼드에서 Fei-Fei Li 지도 아래 박사학위를 받았습니다. 박사 연구는 CNN/RNN과 컴퓨터비전·자연어의 결합이 중심이었습니다. 출처

즉 학문 계보도 재미있습니다.

Hinton → Sutskever
Fei-Fei Li → Karpathy

그리고 카파시도 토론토대 시절 힌턴의 수업과 연구모임을 접하면서 딥러닝에 본격적으로 들어갔다고 직접 밝히고 있습니다. 출처

2. 수츠케버의 경력은 ‘현대 딥러닝의 핵심 계보’에 가깝습니다

수츠케버는 박사과정 때부터 Alex Krizhevsky, Geoffrey Hinton과 AlexNet을 개발했습니다. 2012년 ImageNet에서 기존 방식들을 압도하면서 딥러닝 붐을 촉발한 역사적 사건입니다. 출처

이후 경력은 대략

Toronto/Hinton → DNNResearch → Google Brain → OpenAI → SSI

입니다.

Google Brain에서는 Sequence-to-Sequence(Seq2Seq) 모델 개발에 참여했습니다. 현재 번역·언어모델 계열 기술의 중요한 전신입니다. TensorFlow 초기 개발과 Google Brain Residency에도 관여했습니다. 출처

2015년에는 OpenAI 공동창업자가 되었고, Research Director와 Chief Scientist를 맡으면서 GPT 계열을 포함한 OpenAI의 핵심 연구 방향을 이끌었습니다. 2024년 OpenAI를 떠났고, 이후 Safe Superintelligence(SSI)를 창업했습니다. 출처

2026년 현재 SSI의 목표는 특이합니다. 당장 ChatGPT 같은 소비자 제품을 만드는 회사라기보다는 안전한 초지능(superintelligence)을 만드는 데 연구역량을 집중하는 연구회사에 가깝습니다. 출처

3. 카파시 경력은 훨씬 ‘현장 엔지니어링’ 쪽이 강합니다

카파시는

Toronto → UBC → Stanford → OpenAI → Tesla → OpenAI → Eureka Labs

라는 경로입니다.

박사과정 때 Stanford의 유명한 딥러닝 강좌 CS231n: Convolutional Neural Networks for Visual Recognition을 Fei-Fei Li와 설계하고 직접 강의했습니다. 이 강의는 전 세계 딥러닝 개발자들에게 상당한 영향을 끼쳤습니다. 출처

2015~2017년에는 OpenAI 초기 멤버로 일했고, 2017년에 Tesla로 이동했습니다.

Tesla에서는 약 5년간 Director/Sr. Director of AI로 Autopilot의 컴퓨터비전 팀을 이끌었습니다. 데이터 라벨링부터 neural network training, Tesla의 자체 inference chip에 모델을 배포하는 것까지 실제 자동차에서 돌아가는 전체 AI stack을 담당했습니다. 출처

2023년에 다시 OpenAI로 돌아가 mid-training과 synthetic data 관련 팀을 만들었고, 2024년에 다시 나왔습니다. 현재는 Eureka Labs를 창업하고 AI 교육과 연구·강의를 병행하고 있습니다. 출처

4. 두 사람의 능력 차이를 단순화하면

수츠케버는 이런 질문을 하는 사람에 더 가깝습니다.

“지능이란 무엇인가?”
“신경망을 계속 확장하면 어디까지 갈 수 있는가?”
“AGI·Superintelligence를 만드는 근본 원리는 무엇인가?”

카파시는 이런 질문에 더 가깝습니다.

“신경망을 실제로 어떻게 학습시키지?”
“수백만 대 차량에서 어떻게 돌리지?”
“LLM 내부가 실제 코드 수준에서 어떻게 작동하지?”

그래서 개발자 입장에서는 카파시가 훨씬 친숙하게 느껴질 수 있습니다. 직접 코딩하면서 GPT를 바닥부터 만드는 nanoGPT, micrograd 같은 프로젝트나 긴 강의를 공개하기 때문입니다.

반대로 수츠케버는 최근 몇 년간 코딩 튜토리얼이나 구현물보다는 AI 연구 방향, generalization, reasoning, superintelligence 같은 좀 더 근본적인 문제에 집중하는 편입니다.

5. 둘 중 누가 더 ‘대단한 연구자’냐고 하면

순수한 현대 AI 연구사에 끼친 영향만 놓고 보면 보통은 수츠케버를 한 단계 더 위에 두는 평가가 많습니다.

AlexNet → Seq2Seq → Google Brain → OpenAI → GPT/AGI 연구라는 흐름의 한가운데에 계속 있었기 때문입니다. 토론토대 역시 그를 현대 AI를 형성한 가장 영향력 있는 인물 가운데 하나로 소개하고 있습니다. 출처

반면 연구 + 실제 대규모 AI 시스템 구축 + 코딩 + 교육을 합치면 카파시는 굉장히 독특합니다.

특히 카파시는 세계 정상급 연구자이면서도 “코드를 직접 아주 잘 짜고, 그것을 다른 개발자에게 설명하는 능력”이 비정상적으로 뛰어난 케이스라고 볼 수 있습니다.

한 문장으로 줄이면,

수츠케버 = 현대 딥러닝과 AGI 연구의 설계자형 연구자
카파시 = 딥러닝 연구를 실제 시스템과 코드로 구현하는 연구자·엔지니어·교육자

입니다.

그리고 둘은 의외로 동갑에 매우 가깝고, 둘 다 토론토대에서 딥러닝을 접했으며, 둘 다 OpenAI 초기 핵심 인물이라는 공통점이 있습니다. 이 두 사람을 제프리 힌턴, 얀 르쿤, 요슈아 벤지오, 데미스 허사비스까지 포함해서 ‘AI 인물 계보도’로 놓고 보면 누가 어떤 계열인지 훨씬 재미있게 보입니다.

사용자 #03

토론토대에서 서로 만났을 확률은? 친구 아냐?

ChatGPT #04

가능성은 꽤 높습니다. 다만 “토론토대 시절부터 친구였다”는 확실한 공개 증거는 제가 찾은 자료에는 없습니다.

시기가 상당히 겹칩니다. 수츠케버는 토론토대에서 학사 2005년, 석사 2007년, 박사 2013년까지 거의 10년간 있었고, 카파시는 2005~2009년 토론토대 학부생이었습니다. 즉 2005~2009년 약 4년간 같은 학교에 동시에 있었습니다. 출처

더 중요한 건 단순히 같은 대학이었다는 점이 아닙니다. 카파시는 토론토대에서 딥러닝에 빠진 계기로 Geoff Hinton의 수업과 reading group을 직접 언급합니다. 출처 당시 수츠케버는 바로 그 Hinton 머신러닝 그룹의 대학원생이었습니다. 수츠케버 자신의 박사논문 감사문을 보면 당시 ML 그룹 학생들과 포닥들이 매우 밀접하게 교류했던 작은 연구 커뮤니티였다는 것도 확인됩니다. 출처

그래서 제 추정은 이렇습니다.

“서로 얼굴도 모르고 지나쳤다”보다는 “적어도 알고 지냈을 가능성이 상당히 높다” 쪽입니다. 특히 카파시가 Hinton의 reading group에 실제로 참석했다면, 당시 Hinton의 핵심 제자였던 수츠케버를 한 번도 만나지 않았을 가능성은 오히려 낮아 보입니다. 다만 이것은 정황상 추론이지, 두 사람이 “우리는 U of T 때부터 친구였다”고 공개적으로 밝힌 자료를 근거로 한 것은 아닙니다.

그리고 늦어도 2015년 OpenAI 창립 시점에는 확실히 가까운 동료 관계가 됩니다. 수츠케버는 OpenAI 공동창업자이자 연구책임자였고, 카파시도 OpenAI의 초기 founding member/research scientist였습니다. 출처

시간축으로 보면 더 재미있습니다.

2005
수츠케버: 토론토대 학사 졸업 → 대학원
카파시: 토론토대 학부 입학

2005–2009
둘 다 토론토대.
카파시 → Hinton 수업/reading group 참여
수츠케버 → Hinton 연구실 대학원생

2009
카파시 → UBC로 이동

2012
수츠케버 + Hinton + Krizhevsky → AlexNet

2015
수츠케버 + 카파시 → 둘 다 초기 OpenAI

따라서 둘의 관계를 “학교 동창 → 같은 딥러닝 학파 → OpenAI 초기 동료” 정도로 표현하는 건 상당히 타당합니다.

다만 “친구”였는지는 별개예요. 공개적으로 알려진 수츠케버의 토론토 시절 매우 가까운 연구 동료는 오히려 Alex Krizhevsky 쪽이 훨씬 명확합니다. AlexNet도 둘이 Hinton 밑에서 같이 만들었으니까요. 출처

원하시면 제가 수츠케버·카파시·크리제브스키·힌턴이 2005~2015년에 실제로 어떻게 연결됐는지 인맥도를 그려드릴게요. 꽤 흥미로운 AI 족보가 나옵니다.

사용자 #05

AlexNet 이 크리제브스키 이름에서 딴거야?

ChatGPT #06

네. AlexNet의 “Alex”는 Alex Krizhevsky(알렉스 크리제브스키)의 이름에서 따온 겁니다.

2012년 ImageNet 대회에서 큰 성과를 낸 그 CNN 모델은 Alex Krizhevsky, Ilya Sutskever, Geoffrey Hinton이 함께 만든 모델인데, 논문 제목은 *ImageNet Classification with Deep Convolutional Neural Networks*였습니다. 이후 연구 커뮤니티에서 첫 저자인 Alex Krizhevsky의 이름을 따서 AlexNet이라고 부르게 됐습니다.

즉:

AlexNet = Alex Krizhevsky의 Alex + Network

입니다.

재미있는 점은 논문 자체에서 처음부터 공식 제품명처럼 “AlexNet”이라고 크게 내세운 게 아니라, 나중에 연구자들이 편의상 그렇게 부르면서 이름이 굳어진 겁니다.

사용자 #07

알렉스는 어떤 인물이야?

ChatGPT #08

알렉스 크리제브스키(Alex Krizhevsky)는 캐나다의 컴퓨터과학자이자 딥러닝 연구자입니다. 대중적 인지도는 수츠케버나 카파시보다 낮지만, 현대 딥러닝 역사에서 굉장히 중요한 인물입니다. 특히 AlexNet의 실질적인 구현을 맡은 핵심 인물로 알려져 있습니다. 출처

그는 토론토대에서 제프리 힌턴 연구그룹에 있었고, 2009년에는 CIFAR-10과 CIFAR-100 데이터셋을 만들었습니다. 이 데이터셋은 지금도 머신러닝 입문·벤치마크에서 자주 등장합니다. 이후 GPU용 CNN 학습 코드인 cuda-convnet을 직접 개발했고, 이것이 AlexNet으로 이어졌습니다. 출처

2012년에는 Alex Krizhevsky + Ilya Sutskever + Geoffrey Hinton 세 사람이 AlexNet을 만들었습니다. 당시 AlexNet은 약 6천만 개의 파라미터를 가진 CNN이었고, GTX 580 GPU 두 장을 이용해 ImageNet을 학습했습니다. ImageNet 2012 대회에서 top-5 오류율 약 15.3%를 기록해 2위와 10%p 이상 차이를 냈습니다. 이 결과가 “GPU로 거대한 신경망을 학습하면 기존 컴퓨터비전 방식보다 훨씬 강력할 수 있다”는 걸 결정적으로 보여줬습니다. 출처

특히 재미있는 일화가 있습니다. 힌턴이 나중에 AlexNet 프로젝트를 이렇게 요약했습니다.

“Ilya thought we should do it, Alex made it work.”

즉 대략 “일리야가 이걸 해야 한다고 생각했고, 알렉스가 실제로 돌아가게 만들었다”는 뜻입니다. 출처

이 말이 세 사람의 역할을 꽤 잘 보여줍니다.

  • Hinton: 신경망에 대한 큰 이론적 방향과 지도
  • Sutskever: 대규모 딥러닝을 ImageNet에 적용하자는 연구 아이디어와 방향
  • Krizhevsky: CUDA 코드, GPU 학습, 네트워크 튜닝 등 실제로 시스템을 구현하고 성능을 만들어낸 엔지니어링

특히 크리제브스키는 부모님 집 침실에 설치한 컴퓨터에서 GPU 두 장으로 수개월 동안 네트워크를 반복해서 학습하고 튜닝했다고 알려져 있습니다. 당시에는 지금처럼 PyTorch가 있는 시대도 아니었기 때문에 CUDA/C++ 코드를 직접 만들어야 했습니다. 그래서 상당히 강한 low-level GPU 엔지니어링 능력을 가진 연구자였습니다. 출처

AlexNet 이후 세 사람은 DNNResearch라는 회사를 만들었고, 이 회사를 Google이 인수했습니다. 크리제브스키도 Google에서 딥러닝과 컴퓨터비전 연구를 했고 로봇 비전 연구에도 참여했습니다. 출처

그런데 크리제브스키의 특이한 점은 엄청난 성공 이후 오히려 전면에 거의 등장하지 않았다는 것입니다. 수츠케버는 OpenAI 공동창업자가 되었고, 힌턴은 AI 분야의 상징적인 인물이 됐지만, 크리제브스키는 Google을 떠난 뒤 비교적 조용한 연구자 생활을 해왔습니다. 그래서 일반 대중에게는 이름이 덜 알려져 있습니다. 출처

세 사람을 아주 단순하게 비교하면 이런 느낌입니다.

인물특히 강했던 부분
Geoffrey Hinton이론·연구 방향
Ilya Sutskever새로운 딥러닝 아이디어와 스케일링
Alex KrizhevskyGPU 구현·실험·최적화

그래서 AlexNet이라는 이름이 붙은 것도 단순히 제1저자였기 때문만이 아니라, 실제로 AlexNet을 구현하고 학습시킨 사람이 크리제브스키였다는 의미가 큽니다.

흥미로운 건 카파시까지 포함하면 크리제브스키와 카파시는 둘 다 상당히 강한 ‘연구자+프로그래머’형인데도 성향이 꽤 다릅니다. 원하시면 다음에 Krizhevsky vs Sutskever vs Karpathy 세 사람의 코딩·수학·연구능력 차이까지 비교해드릴게요.

사용자 #09

Alex Krizhevsky 이 사람에 대해서 조금 더 알려 줘. 가족이나 현재 상태나 이런 거.

ChatGPT #10

알렉스 크리제브스키는 의외로 사생활과 현재 활동이 거의 공개되지 않은 인물입니다. 그래서 가족관계나 결혼 여부처럼 개인적인 부분은 공개적으로 확인되는 정보가 매우 적습니다.

공개적으로 확실히 알려진 건 이 정도입니다. 그는 러시아계 배경을 가진 캐나다 컴퓨터과학자로 알려져 있고, 토론토대에서 제프리 힌턴 밑에서 연구했습니다. 2009년 CIFAR-10/100 데이터셋을 만들었고, 이후 수츠케버·힌턴과 함께 AlexNet을 개발했습니다. AlexNet 성공 뒤 세 사람의 회사 DNNResearch가 Google에 인수되면서 Google로 갔습니다. 출처

Google에서는 딥러닝과 컴퓨터비전 연구를 계속했지만, 2017년경 Google을 떠난 것으로 알려져 있습니다. 이후 캐나다의 AI 회사 Dessa와 연관된 활동이 있었고, 2018년에는 자율주행 연구인 ChauffeurNet 논문에 공동저자로 참여했습니다. 이 논문은 실제 차량을 imitation learning으로 운전시키는 연구였습니다. 출처

다만 그 뒤부터는 상당히 조용합니다. 2026년 현재 공개적으로 확인되는 최신 학술 프로필도 여전히 University of Toronto affiliation으로 표시되는 경우가 있지만, 이것이 실제 현직 교수나 직원이라는 뜻은 아닙니다. Google Scholar 같은 프로필은 오래된 소속이 그대로 남아 있을 수 있어서 현재 직장을 단정하기 어렵습니다. 출처

가족 이야기는 더 희박합니다. 부모, 배우자, 자녀에 대한 신뢰할 만한 공개 자료가 거의 없습니다. 유명 연구자들 중에서도 특히 개인 노출을 피하는 타입에 가깝습니다. 인터뷰, 강연, SNS 활동도 수츠케버나 카파시에 비해 매우 적습니다.

그래서 현재 상태를 가장 정확하게 표현하면 “AI 업계에서 은퇴했다고 확인된 것은 아니지만, 공개적인 연구·회사 활동에서 거의 모습을 드러내지 않는 상태”입니다. 2018년 이후 저자로 활발하게 논문을 발표하는 모습도 거의 보이지 않습니다.

이 사람이 더 흥미로운 이유는, AlexNet이라는 딥러닝 역사상 가장 유명한 모델 중 하나의 주역인데도 이후에 CEO도 안 되고, 유명 강연자도 안 되고, SNS 스타도 안 되고, 조용히 사라진 편이라는 점입니다.

원하시면 제가 다음으로 “왜 크리제브스키가 Google을 떠났고 이후 거의 사라졌는지”에 대해 인터뷰·기사 중심으로 더 파서 정리해드릴게요.

사용자 #11

어 좀 더 파봐.

ChatGPT #12

공개 자료가 워낙 적은 인물이라, 이번엔 구글 퇴사 전후 인터뷰·논문·회사 기록·최근 흔적을 나눠서 확인해보겠습니다. 확인되는 사실과 추정은 분리해서 정리할게요.

ChatGPT #13

조금 더 파보니, “왜 갑자기 사라졌나”에 대해서는 생각보다 꽤 명확한 단서가 하나 있습니다. 알렉스 크리제브스키는 Google에서 밀려난 게 아니라, 본인이 연구에 흥미를 잃어서 2017년 9월 스스로 떠났다고 직접 말했습니다.

Quartz가 2018년에 크리제브스키를 직접 인터뷰했는데, 이 기사는 꽤 귀합니다. 당시 그는 언론 인터뷰를 거의 하지 않던 사람이었고, 기사에서도 그를 *soft-spoken*하고 언론과 이야기해본 적이 거의 없는 인물로 묘사합니다. Google에서는 처음에 Google Photos 관련 딥러닝을 했고 이후 자율주행 프로젝트에 깊이 참여했습니다. 그런데 2017년 떠난 이유에 대해 본인이 간단히 “그 일에 흥미를 잃었다”고 설명합니다. 출처

그렇다면 지금은 뭐 하는 사람인가?

여기서부터가 상당히 특이합니다.

2018년 그는 토론토의 AI 회사 Dessa에 *exclusive technical advisor*로 합류했습니다. 정규직 연구책임자라기보다는, 새로운 딥러닝 기술과 엔지니어링 문제에 조언하는 역할이었습니다. 당시 크리제브스키는 Dessa 팀의 기술 수준과 문화가 마음에 들었다고 직접 이야기했습니다. 출처

그와 거의 같은 시기에 자율주행 연구도 하나 더 남겼습니다.

ChauffeurNet: Learning to Drive by Imitating the Best and Synthesizing the Worst

라는 논문으로, Waymo 연구진 Mayank Bansal, Abhijit Ogale과 함께했습니다. 실제 자동차가 사람의 운전을 imitation learning으로 배우도록 하는 연구였고, 2018년 arXiv에 공개된 뒤 2019년 RSS에 발표됐습니다. 출처

그리고 중요한 부분이 있습니다.

학술 데이터베이스 DBLP에서 확인되는 크리제브스키의 마지막 주요 논문도 사실상 이 2019년 ChauffeurNet입니다. 그 이후 논문이 줄줄이 나오는 수츠케버·카파시 같은 커리어가 아닙니다. 출처

그래서 2019년 이후 공식적인 연구 활동은 정말 눈에 띄게 사라집니다.

하지만 완전히 은둔한 건 아니다

흥미로운 단서가 하나 더 있습니다.

2021년 New Yorker가 일본의 빵 이미지 인식 AI에 관한 기사를 취재하면서 크리제브스키와 직접 Zoom 인터뷰를 했습니다.

기자가 현대 신경망이라면 제과류 이미지를 얼마나 잘 인식할 수 있겠느냐고 묻자, 크리제브스키가 neural network의 low-level feature가 이미지들 사이에서 상당히 공유되기 때문에 현대 방식이라면 충분히 가능할 거라는 취지로 기술적인 답변을 합니다. 출처

그러니까 적어도 당시에는

잠적 → 연락두절

같은 상황은 전혀 아니었습니다.

오히려

대기업이나 대학에서 정규직 연구자로 활동하지 않으면서 필요한 경우 기술적인 논의나 자문에는 응하는 상태

에 가까워 보입니다.

2026년 현재까지 제가 확인한 공개자료에서는 새 AI 스타트업 창업, 교수직 취임, 빅테크 복귀 같은 뚜렷한 새로운 직책은 확인되지 않습니다.

---

더 재미있는 것은 크리제브스키의 성격입니다

제프리 힌턴의 평가가 굉장히 강합니다.

2023년 New Yorker 인터뷰에서 힌턴은 크리제브스키를

자기가 만나본 사람 중 아마 최고의 프로그래머

수준으로 평가합니다. 출처

이게 단순한 칭찬으로 보기 어려운 게, 힌턴은 수십 년 동안 세계 최고 수준의 연구자·학생들을 지도한 사람입니다.

그런데 크리제브스키의 스타일은 카파시와도 상당히 다릅니다.

카파시라면 자기가 구현한 것을 GitHub에 올리고, 강의하고, YouTube에서 두 시간 동안 설명하고, 블로그에 씁니다.

크리제브스키는 반대입니다.

만들고 → 결과가 나오면 → 다음 문제로 이동.

자기 자신을 브랜드화하려는 모습이 거의 없습니다.

Quartz가 인터뷰했을 때도 AlexNet 성공 직후를 이야기하며, ImageNet 결과가 나온 뒤 수많은 인수 제안 이메일이 몰려오는 상황이 자신에게는 상당히 비현실적으로 느껴졌다고 회상했습니다. 출처

---

AlexNet을 만들 때 생활도 꽤 특이했습니다

이 부분은 힌턴의 직접 회고가 있습니다.

크리제브스키는 우크라이나에서 태어난 이민자 출신으로 소개되며, 캐나다에서 부모와 함께 살았습니다. AlexNet 학습에 사용한 GTX GPU 두 장이 돌아가던 컴퓨터도 부모님 집 자기 방에 있었습니다.

GPU가 계속 돌아가면서 전기를 상당히 먹었는데, 힌턴은 농담처럼 그 전기료를 부모님이 부담했다고 회상했습니다. 출처

그리고 여기서 중요한 정정 하나가 있습니다. 제가 앞서 그를 단순히 “러시아계/러시아 출생”이라고 표현했는데, 신뢰할 만한 최근 자료에서는 Ukrainian-born, 즉 우크라이나 출생으로 소개합니다. 당시에는 소련이었기 때문에 인터넷 자료에서 Soviet-born/Russian-born/Ukrainian-born 표현이 혼재하는 경우가 있습니다. 출처

---

부모 외의 가족은?

여기는 공개정보가 거의 없습니다.

제가 확인한 신뢰할 만한 자료에서는 배우자 이름, 결혼 여부, 자녀 여부를 확인할 수 없습니다.

이건 “미혼이다”라는 뜻이 아닙니다.

공개하지 않았다는 뜻입니다.

부모 이야기가 알려진 것도 AlexNet 컴퓨터가 부모 집에 있었기 때문에 나온 일화이지, 본인이 가족생활을 공개해서 알려진 게 아닙니다.

SNS도 유명 AI 연구자치고는 사실상 존재감이 없습니다. 그래서 가족이나 일상을 추적할 만한 공개 자료 자체가 거의 없습니다.

---

왜 그렇게 살 수 있었을까?

여기부터는 공개 사실을 토대로 한 추정입니다.

AlexNet 직후 Hinton, Sutskever, Krizhevsky 세 사람은 DNNResearch라는 회사를 만들었고, Google이 이 회사를 인수했습니다.

당시 세 사람은 이미 여러 기업으로부터 상당한 관심과 인수 제안을 받고 있었습니다. 출처

따라서 크리제브스키는 20대 후반~30대 초반에 이미 상당한 경제적 자유를 확보했을 가능성이 높습니다.

다만 그가 Google 인수로 정확히 얼마를 벌었는지는 공개된 신뢰할 만한 숫자가 없습니다. 그래서 “몇천만 달러를 벌었다” 같은 이야기는 근거 없이 단정하면 안 됩니다.

그렇지만

DNNResearch 매각 + Google 선임 연구자 경력

을 고려하면 경제적인 이유로 계속 회사에 다녀야만 하는 상황은 아니었을 가능성이 상당히 높습니다.

---

그리고 수츠케버와의 관계를 보면 성격이 조금 더 보입니다

수츠케버의 박사논문 acknowledgements를 보면 재미있는 문장이 있습니다.

여러 연구자들에게 감사한 뒤, 공동 연구자 중에서도 “especially Alex Krizhevsky and James Martens”라고 특별히 크리제브스키를 따로 언급합니다. 출처

즉 둘은 단순히

“AlexNet 논문 한번 같이 쓴 사람”

정도가 아니라, 토론토 Hinton 연구실에서 상당히 가까운 연구 동료였던 것으로 보입니다.

그래서 제가 세 사람의 성향을 현재까지 공개된 정보로 압축한다면 이렇게 봅니다.

Ilya Sutskever
→ 큰 질문을 계속 쫓음
→ OpenAI → Superalignment → SSI
→ “어디까지 지능을 만들 수 있는가?”

Andrej Karpathy
→ 연구 + 엄청난 구현력 + 교육
→ Tesla/OpenAI → 강의·오픈소스
→ “이걸 어떻게 실제로 만들고 설명할까?”

Alex Krizhevsky
→ 엄청난 구현력 + 문제 해결
→ 문제를 해결하면 관심이 다음으로 이동
→ 명성·회사경영·대중활동에는 별 관심을 보이지 않음

그래서 크리제브스키는 꽤 독특합니다.

현대 AI 혁명을 실제로 촉발한 프로그램을 만든 사람 중 하나인데, 그 지위를 이용해서 유명 CEO나 AI 권위자가 되는 길을 거의 택하지 않은 사람입니다.

그리고 힌턴의 증언까지 합치면, 단순히 “AlexNet 논문 1저자라 유명해진 운 좋은 대학원생”은 전혀 아닙니다. 세계 최고 수준의 연구자들이 인정한 아주 강력한 프로그래머·연구 엔지니어였다고 보는 게 맞습니다. 출처

재미있는 건 여기서 한 단계 더 들어가서 “AlexNet에서 실제로 Krizhevsky가 짠 코드와 Sutskever가 한 일이 각각 무엇이었나”를 보면 둘의 능력 차이가 상당히 선명하게 드러난다는 점입니다.

사용자 #14

한 단계 더 들어가다.

ChatGPT #15

들어가 보면 AlexNet은 “세 사람이 똑같이 만든 프로젝트”라기보다 역할 분담이 상당히 뚜렷했던 프로젝트에 가깝습니다.

핵심을 먼저 말하면,

**수츠케버가 “ImageNet처럼 큰 데이터에 신경망을 스케일하면 된다”는 방향을 강하게 밀었고,
크리제브스키가 그 아이디어를 실제 GPU 코드와 수많은 실험으로 성능이 나오게 만들었으며,
힌턴이 전체 연구 방향과 조언을 맡았습니다.**

힌턴이 나중에 농담 섞어 정리한 말이 거의 정확한 요약입니다.

“Ilya thought we should do it, Alex made it work.”

즉 “일리야가 이걸 해야 한다고 생각했고, 알렉스가 실제로 작동하게 만들었다.” 출처

크리제브스키가 실제로 한 일

크리제브스키는 AlexNet 전부터 이미 CUDA로 CNN을 직접 구현하고 있었습니다.

당시 그의 토론토대 홈페이지를 보면 GTX 280에서 돌아가는 CUDA CNN을 직접 만들어 놓았는데, CPU C 구현보다 약 140배 빠르다고 기록해 놓았습니다. 지금은 PyTorch에서 Conv2d() 한 줄 쓰면 되지만, 당시에는 GPU convolution kernel 자체를 상당 부분 직접 최적화해야 했습니다. 출처

이 코드를 발전시킨 게 cuda-convnet입니다.

ImageNet을 하게 되자 그는 이를 다시 뜯어고쳐서

  • GPU 2장에 네트워크를 나누어 학습
  • GPU 메모리 제한 처리
  • convolution CUDA 최적화
  • 데이터 로딩 파이프라인
  • augmentation
  • learning rate
  • momentum
  • weight decay
  • layer 크기
  • filter 크기
  • 네트워크 깊이

같은 것을 계속 조정했습니다.

이건 단순한 “코딩 담당”이 아닙니다.

딥러닝에서는 이런 선택 하나하나가 연구 자체입니다.

실제로 AlexNet 논문에서 중요한 혁신 중 하나는 매우 효율적인 GPU convolution 구현이라고 명시되어 있습니다. 출처

그리고 거의 1년 동안 튜닝했습니다

처음부터 AlexNet이 압도적으로 잘된 게 아닙니다.

ImageNet에서 당시 최고 수준 성능에 도달하기까지 약 6개월, 그 다음 그 수준을 넘어 압도적인 결과를 만들기까지 다시 약 6개월이 걸렸다는 당시 관계자 설명이 있습니다. 출처

즉 크리제브스키는

코드 수정 → 5~6일 학습 → 결과 확인 → 구조 변경 → 다시 학습

을 계속 반복한 겁니다.

현재 LLM 연구에서도 상당히 비슷합니다.

모델 하나를 학습시키는 것보다 어떤 변화가 실제 성능을 높이는지 판단하는 감각이 굉장히 중요합니다.

수츠케버도 크리제브스키를 두고

“extremely deep understanding of machine learning”
“an engineer at heart”

라고 평가했습니다.

즉 머신러닝을 아주 깊게 이해하면서 본질적으로 엔지니어인 사람이라고 한 겁니다. 출처

---

그러면 수츠케버는 뭘 했나?

여기서 수츠케버의 역할을 과소평가하면 안 됩니다.

당시 중요한 질문은 단순히

“CNN을 더 빠르게 만들자”

가 아니었습니다.

수츠케버가 가지고 있던 핵심 믿음은

신경망의 성능은 데이터와 계산량을 크게 늘리면 계속 좋아질 것이다

라는 것이었습니다.

지금 들으면 당연하지만 2010~2011년에는 전혀 당연한 생각이 아니었습니다.

당시 컴퓨터비전 주류는 handcrafted feature였습니다.

예를 들어

이미지 → SIFT/HOG 같은 특징 추출 → classifier

식이었습니다.

깊은 신경망을 ImageNet의 100만 장 이상의 이미지와 1,000개 클래스에 적용하는 건 상당히 무모해 보이는 아이디어였습니다.

IEEE/Computer History Museum의 AlexNet 역사에서도 Sutskever가 ImageNet의 등장과 신경망 scaling을 연결했고, Krizhevsky에게 ImageNet에서 CNN을 돌리자고 설득했다고 정리합니다. 출처

흥미롭게도 힌턴조차 처음에는 완전히 확신하지 않았습니다.

힌턴은 supervised learning에 의존하는 ImageNet 접근에 처음에는 회의적이었고, 프로젝트에서는 PI·advisor 역할을 했다는 당시 회고가 있습니다. 출처

그러니까 구도를 조금 과감하게 단순화하면

Sutskever:
“엄청난 데이터를 넣으면 neural net이 먹힐 겁니다.”

Krizhevsky:
“그러면 내가 GPU에서 실제로 돌려보겠다.”

Hinton:
“좋아. 해보자.”

에 가까웠습니다.

---

논문 안에서도 Krizhevsky의 흔적이 강합니다

논문 저자 순서도

**Alex Krizhevsky
Ilya Sutskever
Geoffrey Hinton**

입니다. 출처

AlexNet에는 지금 보면 평범하지만 당시에는 상당히 중요한 선택들이 들어갔습니다.

ReLU

당시 많이 쓰던 sigmoid/tanh 대신 ReLU를 사용했습니다.

AlexNet 논문에서는 ReLU가 tanh보다 훨씬 빠르게 학습된다는 실험을 직접 보여줍니다. 출처

GPU 두 장

60M 수준의 parameter를 당시 GPU 한 장에 넣기 어려워 네트워크를 두 GPU에 분할했습니다.

Data augmentation

이미지를 crop하고 horizontal reflection을 이용해서 training set을 사실상 늘렸습니다.

Dropout

fully connected layer의 overfitting을 억제하는 데 사용했습니다.

Overlapping pooling

pooling 영역을 약간 겹치게 하는 방식을 사용했습니다.

그리고 가장 중요한 것은

이 조합 전체가 실제 ImageNet에서 작동하도록 만든 것

입니다.

각각의 아이디어 자체는 완전히 새것이 아닌 것도 많았습니다.

하지만

CNN + ReLU + GPU + 엄청난 데이터 + augmentation + dropout

을 하나의 대규모 시스템으로 만들었더니 갑자기 기존 방법을 박살내 버린 겁니다.

2012 ILSVRC에서 AlexNet은 top-5 error 15.3%, 2위가 26.2%였습니다. 출처

이건 약간 잘한 수준이 아니라 격차가 너무 커서 연구 방향 자체가 바뀐 결과였습니다.

---

그래서 Alex와 Ilya의 가장 큰 차이가 여기서 보입니다

제가 보기엔 이 사건에서 두 사람의 재능이 아주 선명하게 갈립니다.

Ilya Sutskever

“어떤 방향으로 가야 하는가?”

를 굉장히 잘 보는 사람입니다.

데이터 ↑
compute ↑
model ↑

하면 성능이 계속 좋아진다는 방향을 일찍 믿었습니다.

이 사고방식은 이후

AlexNet → Seq2Seq → 대규모 language model → GPT

로 놀랄 만큼 일관되게 이어집니다.

즉 scaling trajectory를 읽는 능력이 뛰어났다고 볼 수 있습니다.

Alex Krizhevsky

반대로 질문이

“그 아이디어를 진짜 작동하게 만들 수 있는가?”

입니다.

CUDA kernel, 메모리, numerical stability, hyperparameter, architecture, GPU 통신 등을 다 해결해서

이론적으로 가능한 것을 실제 결과로 만들어버리는 능력

이 엄청났던 겁니다.

---

그리고 이것 때문에 아까 이야기했던 Karpathy와 Krizhevsky의 차이도 재미있습니다.

둘 다 엄청난 프로그래머인데,

Krizhevsky
→ 극단적인 optimizer / systems hacker형
→ GPU 바닥까지 내려감
→ 모델을 최고 성능으로 만드는 데 집중

Karpathy
→ end-to-end AI engineer형
→ 모델 + 데이터 + 시스템 + 제품
→ 거기에 설명과 교육까지 뛰어남

Sutskever
→ research intuition형
→ 어떤 방향으로 scale해야 다음 breakthrough가 나올지 보는 능력이 강함

정도로 구분할 수 있습니다.

그래서 2011년 토론토의 Hinton 연구실에 Sutskever와 Krizhevsky 두 사람이 동시에 있었다는 게 상당히 중요한 우연이었다고 봅니다. 한 사람만 있었다면 AlexNet이 같은 시기에 나왔을지는 꽤 의문입니다. 출처

그리고 여기서 정말 재미있는 다음 단계가 있습니다. “AlexNet 소스코드를 실제로 보면 2012년에 Krizhevsky가 얼마나 저수준까지 직접 구현했는가”를 볼 수 있습니다. 요즘 PyTorch 코드와 비교하면 충격적일 정도로 다릅니다.

ChatGPT #16

Seq2Seq는 “Sequence-to-Sequence”의 줄임말입니다. 쉽게 말해, 길이가 있는 입력 시퀀스를 받아서 다른 길이의 출력 시퀀스로 바꾸는 신경망 구조예요.

대표적인 예가 번역입니다.

I love you
→ 나는 너를 사랑해

입력도 단어들의 sequence, 출력도 단어들의 sequence죠.

2014년 Google의 Ilya Sutskever, Oriol Vinyals, Quoc V. Le가 발표한 *Sequence to Sequence Learning with Neural Networks* 논문이 특히 유명합니다. 이 논문에서는 LSTM을 사용해서 한 신경망이 입력 문장을 읽어 벡터로 압축하고, 다른 신경망이 그 벡터를 바탕으로 출력 문장을 생성했습니다.

구조는 대략 이렇습니다.

Encoder
I → love → you
→ 문장의 정보를 내부 상태에 압축

Decoder
그 내부 상태를 받아
→ 나는 → 너를 → 사랑해

당시 중요한 점은 번역 규칙을 사람이 일일이 만들지 않고, 문장 전체를 end-to-end neural network로 학습할 수 있다는 걸 강하게 보여줬다는 것입니다.

수츠케버에게 Seq2Seq가 중요한 이유도 여기 있습니다. AlexNet에서는 이미지에서 대규모 딥러닝이 먹힌다는 걸 보여줬고, Seq2Seq에서는 언어의 연속된 구조에서도 큰 신경망이 제대로 학습된다는 걸 보여줬습니다.

그리고 이 계보가 나중에

Seq2Seq + Attention → Transformer → GPT

로 이어집니다.

다만 중요한 차이도 있습니다. 초기 Seq2Seq는 주로 RNN/LSTM 기반이었고, GPT는 Transformer 기반입니다. 즉 GPT가 Seq2Seq 모델 그 자체는 아니지만, “입력 시퀀스를 받아 시퀀스를 생성한다”는 문제 설정과 end-to-end 학습 철학은 이어진다고 보면 됩니다.

사용자 #17

반지 소스 코드 기터베에서 찾을 수 있어?

ChatGPT #18

응. 진짜 2012년 AlexNet 원본 소스코드가 GitHub에 공개돼 있어.

가장 중요한 건 이 저장소야:

Computer History Museum의 AlexNet 원본 GitHub 저장소

이건 그냥 누가 논문 보고 다시 만든 구현체가 아니라, 2012년 ImageNet 대회에서 실제로 사용된 원본 AlexNet 코드다. Computer History Museum이 Google과 협의해서 2025년에 공개했다. 저장소에는 당시 코드뿐 아니라 ImageNet으로 학습된 파라미터 파일도 포함돼 있다. 출처

그리고 그보다 앞선 크리제브스키의 원형 프로젝트인 cuda-convnet도 GitHub에서 볼 수 있다. 이게 AlexNet의 직접적인 전신이다. 출처

Alex Krizhevsky의 cuda-convnet2 GitHub

코드를 보면 요즘 PyTorch 스타일과 완전히 다르다. src, CUDA 관련 코드, GPU matrix 연산, convolution 구현, Python 인터페이스가 뒤섞여 있고, 상당 부분을 C++/CUDA 수준에서 직접 구현했다. 당시엔 torch.nn.Conv2d() 같은 고수준 프레임워크가 없었기 때문에 GPU 메모리와 convolution 계산 자체를 직접 다뤄야 했다. 출처

그리고 흥미로운 점 하나. 원본 AlexNet 코드는 오랫동안 공개되지 않았고, 인터넷에 있던 “AlexNet GitHub” 대부분은 논문을 보고 재구현한 버전이었다. 2025년에 CHM과 Google이 특정 2012년 버전을 찾아서 공개한 거다. 출처

원하면 내가 다음 답변에서 그 원본 GitHub 코드를 실제 파일 단위로 뜯어서
convnet.py, CUDA convolution 코드, GPU 2장 분할 부분이 어디인지까지 같이 볼 수 있어.

사용자 #19

이 소스 코드에 백만 장이 넘는 이미지도 같이 들어있나?

ChatGPT #20

아니요. 그 GitHub 저장소에 ImageNet의 100만 장 넘는 원본 이미지가 같이 들어있는 건 아닙니다.

들어있는 것은 주로 AlexNet 원본 소스코드와, ImageNet으로 학습이 끝난 파라미터 파일(weights)입니다. 저장소 README도 “ImageNet dataset으로 학습된 parameter files를 포함한다”고 명시합니다. 출처

즉 구분하면:

  • 소스코드: 있음
  • 학습된 가중치/파라미터: 있음
  • ImageNet 원본 이미지 100만 장 이상: 없음

ImageNet 이미지는 별도 데이터셋이고, 라이선스/배포 조건 때문에 GitHub 저장소에 통째로 넣어둔 형태가 아닙니다.

원하면 제가 다음으로 2012년 AlexNet이 실제로 몇 장의 이미지를 학습에 썼는지, 데이터 용량이 대략 얼마나 됐는지까지 계산해드릴게요.

사용자 #21

계산해 줘. 그리고 그 이미지가 인터넷에 어디 있는지도 좀 찾아봐.

ChatGPT #22

네. 정확한 숫자로 보면 AlexNet 계열이 사용한 ILSVRC 2012 분류 데이터는 다음 규모입니다.

  • 학습: 1,281,167장
  • 검증: 50,000장
  • 테스트: 100,000장
  • 총합: 1,431,167장
  • 클래스 수: 1,000개

공식 ImageNet 설명에서도 이 숫자를 그대로 확인할 수 있습니다. 학습 세트는 클래스당 최소 732장, 최대 1,300장 정도였습니다. 출처

용량은 공식 배포본 기준으로 학습 이미지가 대략 138GB 전후로 알려져 있습니다. JPEG라 이미지마다 크기가 달라 단순 곱셈으로는 정확하지 않지만, 1,281,167장에 138GB라고 잡으면 평균적으로 한 장당 약 108KB 정도입니다.

계산하면:

138 GB ÷ 1,281,167 ≈ 108 KB/image

검증·테스트까지 합치면 전체 이미지 데이터는 대략 150GB 안팎으로 보면 됩니다. 당시 기준으로는 꽤 큰 데이터셋이었습니다.

그리고 중요한 점 하나가 있습니다. 2012년 AlexNet 논문 자체는 “1.2 million high-resolution images”로 표현하지만, 실제 ILSVRC2012 공식 학습셋은 1,281,167장입니다. 출처

그 이미지들은 지금 어디 있나?

현재 가장 정식 경로는 ImageNet 공식 사이트입니다.

ImageNet 공식 다운로드 페이지

현재 ImageNet 공식 페이지는 ILSVRC 2012–2017의 classification/localization 데이터셋이 Kaggle에서도 제공된다고 안내하고 있습니다. 출처

그리고 2012년 당시의 다운로드 페이지도 아직 남아 있습니다.

ILSVRC 2012 공식 다운로드 페이지

여기서는 원본 이미지 다운로드를 위해 로그인이 필요하다고 안내합니다. 출처

Google Research 문서에서도 실제 파일명이 명시돼 있습니다.

ilsvrc2012_img_train.tar

이 파일을 풀면 1,000개의 클래스별 tar 파일이 나오고, 다시 각 tar를 풀면 그 안에 실제 JPEG들이 들어갑니다. 출처

즉 구조가 대략:

ilsvrc2012_img_train.tar
 ├─ n01440764.tar
 │   ├─ n01440764_18.JPEG
 │   ├─ n01440764_36.JPEG
 │   └─ ...
 ├─ n01443537.tar
 ├─ n01484850.tar
 └─ ...
       총 1000개 클래스

입니다.

여기서 n01440764 같은 코드는 WordNet의 synset ID입니다. 사람에게는 그냥 “tench”, “goldfish”, “great white shark”, “tabby cat”, “Labrador” 같은 클래스입니다.

그리고 재미있는 점이 하나 있습니다. ImageNet 전체는 AlexNet이 사용한 128만 장보다 훨씬 큽니다. 현재 ImageNet 공식 페이지에는 전체 데이터베이스가 약 1,419만 장, 21,841 synset이라고 나옵니다. AlexNet이 사용한 것은 그중 엄선된 1,000개 클래스짜리 ILSVRC subset입니다. 출처

또 이 이미지들은 처음부터 연구팀이 직접 사진을 찍은 게 아닙니다. ImageNet은 상당수를 Flickr나 여러 이미지 검색엔진 등 인터넷에서 수집하고 사람이 분류·검증한 데이터셋입니다. ILSVRC 설명에서도 validation/test 사진들이 Flickr 및 검색엔진에서 수집됐다고 명시합니다. 출처

원하시면 다음에는 제가 실제 ImageNet 2012 이미지 몇 장을 찾아서 보여드리고, “이런 평범한 인터넷 사진 128만 장을 AlexNet이 어떻게 224×224로 잘라 GPU에 넣었는지”까지 이어서 설명할 수 있습니다.