쏟아지는 AI 논문, 언어모델로 문헌 리뷰하기

언어모델로 AI 논문을 묶어 떠오르는 주제를 숫자로 짚을 수 있을까? 반기별 언어모델, 부상성 네 지표, 토픽 진화 맵으로 어텐션 논문을 분석한 연구를 읽는다.

어텐션 기법 하나만 보아도 관련 논문의 누적 건수가 2019년 상반기 458건에서 2024년 상반기 18,870건으로 늘었다. 논문은 AI 분야의 출판량이 많고 새 개념과 용어가 계속 나온다고 지적한다. 그래서 전문가 중심의 문헌 리뷰로는 연구 흐름을 제때, 빠짐없이 파악하기 어렵다고 본다.

그래서 이런 질문이 생긴다. 언어모델로 AI 논문을 자동으로 묶어 주제를 찾고, 어떤 주제가 떠오르는 중인지까지 숫자로 짚어 낼 수 있을까?

이 질문에 답한 논문을 한 편 읽어 본다.

  • 제목: Harnessing language models for computational literature review of emerging AI topics
  • 학술지: Information Processing & Management
  • 연도: 2025
  • DOI: 10.1016/j.ipm.2025.104245

논문은 계산 문헌 리뷰(Computational Literature Review, CLR) 방법을 제안한다. CLR은 컴퓨터로 문헌을 체계적으로 모으고 분석하고 종합하는 리뷰 방식이다. 제안 방법은 AI 논문 데이터베이스인 PapersWithCode에서 논문을 모은 뒤 다음 세 가지 일을 한다.

  • 시점마다 AI 논문으로 더 학습한 언어모델을 써서 논문을 묶고 주제(토픽)를 찾는다.
  • 토픽마다 떠오르는 정도를 네 지표로 계산한다.
  • 한 토픽이 앞뒤 시점의 어떤 토픽과 이어지는지 맵으로 보여 준다.

글 전체에서 쓸 용어는 다음과 같다.

  • 사전학습 언어모델(Pre-trained Language Model, PLM): 많은 글로 미리 학습해 문장의 뜻을 숫자 벡터로 바꾸는 모델이다. 논문은 과학 논문용 모델인 SciBERT를 AI 논문으로 더 학습시키고, 이 모델을 AI-SciBERT라 부른다.
  • 부상성(emergingness): 어떤 토픽이 그 시점에 떠오르는 중인 정도다. 논문은 새로움(novelty), 성장(growth), 응집(coherence), 불확실성(uncertainty) 네 지표로 계산한다.
  • 토픽 진화 맵(topic evolution map): 한 토픽을 앞 시점의 선행(先行) 토픽, 다음 시점의 후속 토픽과 이어 보여 주는 맵이다.

동기: AI 연구 흐름은 사람 손만으로 따라가기 어렵다

왜 AI 연구 흐름을 읽는 일이 중요한가

논문은 AI 연구 흐름을 읽는 능력이 연구자뿐 아니라 산업 실무자와 정책 담당자에게도 필요하다고 본다. 논문이 든 이유는 다음과 같다.

  • AI는 실용 잠재력이 크다. 산업, 물리과학, 공공행정, 교육, 의료, 경영에서 성공 사례가 늘고 있다.
  • 최신 AI 연구를 빨리 파악하고 이해하는 능력은 경쟁 우위의 원천이자 증거에 근거한 전략 기획의 바탕으로 여겨진다.
  • 분석은 어렵다. 출판량이 많고, 분야가 여러 학문에 퍼져 있으며, 새 개념과 용어가 계속 나온다.

논문은 이런 어려움이 전문가 중심의 기존 문헌 리뷰가 감당할 수 있는 범위를 자주 넘는다고 지적한다. 그래서 대량의 글을 체계적으로 처리하고 숨은 패턴을 찾는 CLR이 필수 도구가 되고 있다고 본다.

기존 연구가 다루지 않은 부분

선행 연구는 Web of Science와 Scopus 같은 학술 데이터베이스에서 AI 문헌을 모았다. 그리고 잠재 디리클레 할당(Latent Dirichlet Allocation, LDA), 비음수 행렬 분해, Top2Vec, BERTopic 같은 토픽 모델링으로 숨은 주제를 찾았다. 예를 들어 Arsenyan과 Piepenbrink(2024)는 운영연구·경영·경제 분야의 AI 응용 연구 7,708건을 LDA로 분석했다. Guler 등(2024)은 AI 관련 연구 6,974건에서 구조적 토픽 모델로 토픽을 찾고 ChatGPT의 도움을 받아 이름을 붙였다. Agbozo 등(2024)은 농구 중심의 스포츠 분석에 AI를 적용한 연구 383건을 BERTopic으로 분석했다.

논문이 짚은 빈틈은 세 가지다.

  • 자료원: 선행 연구는 대부분 AI가 새로 쓰이는 응용 분야에 집중했다. 어떤 알고리즘이나 모델을 쓰는지는 덜 다루었다. 어텐션, 활성화 함수 같은 특정 기법을 분석하려 하면 기존 검색 도구는 비효율적이다. AI 성과는 학술지보다 학술대회 발표 논문으로 먼저 나오는데, 기존 도구는 주로 학술지 논문을 색인한다.
  • 방법론: 확률 토픽 모델은 단어가 함께 나오는 패턴에 기대므로 단어 하나하나의 뜻과 맥락을 충분히 잡지 못한다. BERT 같은 PLM을 쓴 연구도 있으나, AI 분야 용어에 맞게 조정하지 않고 그대로 쓰면 효율이 떨어진다. 분석 전에 한 번만 학습한 고정 모델은 빠르게 바뀌는 AI 지식을 반영하기 어렵다.
  • 미래 지향 분석: 선행 연구 대부분은 과거 변화를 돌아보는 분석에 그쳤고, 전문가가 결과를 해석해 미래를 전망했다. 앞으로 분야를 이끌 토픽을 정량으로 짚는 과학적 방법이 필요하다.

이 빈틈에서 논문의 연구 질문 두 개가 나온다. 첫째, 어떤 AI 토픽이 부상 중이며 그 특징은 무엇인가. 둘째, 목표 토픽 하나가 주어지면 어떤 진화 경로를 거쳤는가.

방법: 시점별 언어모델로 토픽을 찾고, 부상성을 매기고, 경로를 잇는다

논문은 방법을 3단계로 설명한다. 첫째, AI 특화 PLM과 비지도 군집화로 AI 연구 지형(AI landscape)을 만든다. 둘째, 정량 지표로 토픽의 부상성을 평가한다. 셋째, 대화형 토픽 진화 맵을 만든다. 이 글에서는 논문의 첫 단계에 들어 있는 언어모델 학습과 군집화를 따로 떼어 4단계로 설명한다. 이 글의 1·2단계가 논문의 첫 단계이고, 3단계와 4단계가 논문의 둘째와 셋째 단계다.

그림 1. 시점별 언어모델로 토픽을 찾고, 네 지표로 부상성을 매긴 뒤, 진화 맵으로 토픽을 잇는다.

사례와 자료

자료원은 PapersWithCode다. 논문의 설명에 따르면 PapersWithCode는 2018년에 시작되었고, 기술 운영은 Meta AI가 맡으며, 내용은 전 세계 연구자와 개발자가 함께 쌓는다. 논문 서술 시점의 현황이므로 지금 쓰려면 제공 방식을 다시 확인해야 한다.

논문이 이 자료원을 택한 이유는 세 가지다.

  • 논문을 소스 코드, 공개 학술대회 정보와 연결해 신뢰성, 투명성, 재현성을 준다.
  • 커뮤니티가 관리하는 태그(데이터셋, 방법, 과제)가 있어 정밀하게 검색하고 비교할 수 있다.
  • 대량 데이터셋이나 API 형태로 받을 수 있어 계속 갱신하며 쓰기에 알맞다.

논문 하나에는 방법(Methods), 데이터셋, 과제 태그가 붙는다. 예를 들어 「Attention Is All You Need」 항목에는 학술대회 정보 ‘NeurIPS 2017’, 방법 태그 ‘Linear Layer’와 ‘Absolute Position Encodings’, 데이터셋 태그 ‘Penn Treebank’와 ‘WMT 2014’ 등이 달려 있다.

자료 규모는 다음과 같다.

  • 제목과 초록이 없거나 영어가 아닌 논문을 빼고 AI 논문 506,286건을 얻었다.
  • 이 가운데 2017년 하반기부터 2024년 상반기까지의 논문 409,021건을 데이터셋으로 정리했다.
  • 이 데이터셋을 반년 단위로 누적한 부분집합 11개로 나누었다.
  • 사례 분석 대상은 방법 태그에 ‘Scaled Dot-Product Attention’이 있는 논문 18,870건이다.

사례로 스케일드 닷프로덕트 어텐션을 택한 이유는 현대 AI 모델에서 기본 역할을 하고, 발전이 빠르며, 여러 분야에 영향이 넓기 때문이다.

1단계: 시점별 AI 특화 언어모델 만들기

  • 입력: 반년 단위로 누적한 AI 논문의 제목과 초록
  • 처리: SciBERT를 AI 논문으로 이어서 사전학습
  • 산출: 시점마다 저장한 AI-SciBERT 모델

처리 순서는 다음과 같다.

  1. 논문마다 제목과 초록을 이어 붙여 한 개의 입력 문장열로 만든다.
  2. 원래 SciBERT 모델(allenai/scibert_scivocab_uncased)에서 출발해 AI 논문으로 사전학습을 계속한다. 이 과정을 도메인 적응이라 한다.
  3. 마스크 언어 모델링(Masked Language Modeling, MLM)으로 토큰의 15%를 가리고 맞히게 한다.
  4. 다음 문장 예측도 함께 학습한다. 이웃한 문장은 정답 쌍으로 쓰고, 쌍의 50%는 다른 문서의 문장으로 바꿔 오답 쌍으로 쓴다.
  5. 반년마다 누적된 논문으로 학습한 모델을 시점별로 저장한다.

반년 단위로 모델을 따로 두는 이유는 시점마다 달라지는 표현과 언어 흐름에 모델을 맞추기 위해서다. AI 지식은 빨리 바뀌므로 고정 모델보다 시간에 따라 계속 학습하는 모델이 낫다는 판단이다.

학습 설정은 다음과 같다.

  • 학습률 2e-5, 에포크 3회, 장치당 배치 크기 128
  • 가중치 감쇠 0.01, 워밍업 500단계, 학습률은 선형으로 줄인다.
  • 체크포인트는 10,000단계마다 저장하되 최대 2개만 남긴다. 기록은 100단계마다 남긴다.

2단계: 문서를 벡터로 바꾸고 K-평균으로 토픽 찾기

  • 입력: 어텐션 논문의 텍스트와 해당 시점의 AI-SciBERT
  • 처리: 문서 임베딩, 주성분 분석, K-평균 군집화
  • 산출: 반기마다의 토픽 목록

처리 순서는 다음과 같다.

  1. 해당 시점의 AI-SciBERT로 논문 텍스트를 밀집 벡터로 바꾼다. 마지막 층의 [CLS] 토큰 벡터를 문서 임베딩으로 쓴다.
  2. 계산 효율을 위해 주성분 분석으로 전체 정보의 80%를 설명하는 차원까지 줄인다.
  3. K-평균 군집화로 비슷한 논문을 묶는다. 군집 수는 방법 태그 수의 10%~20% 범위에서 시험한다.
  4. inertia 값의 곡률이 최대인 팔꿈치 지점을 최적 군집 수로 정한다.
  5. 묶인 군집을 그 시점의 AI 토픽으로 정의한다.

논문이 K-평균을 택한 이유는 다섯 가지다.

  • 유클리드 거리로 작동하므로 길이가 고정된 밀집 임베딩에 잘 맞는다. LDA처럼 생성 분포를 가정하지 않는다.
  • 계산이 빠르고 큰 자료로 쉽게 늘릴 수 있다. 차원 축소와 밀도 기반 계층 군집을 거치는 BERTopic, Top2Vec보다 가볍다.
  • 분석가가 군집 수 k를 직접 정해 토픽의 세밀도를 목적에 맞출 수 있다.
  • 중심점에 가까운 문서와 키워드를 뽑아 토픽의 핵심 뜻을 읽기 쉽다.
  • 도메인 적응을 거친 임베딩은 의미가 더 일관되어 토픽이 더 잘 나뉜다.

사례에서 반기별 토픽 수는 29개에서 111개로 늘었다. 같은 기간 누적 문서는 2019년 상반기 458건에서 2024년 상반기 18,870건으로 약 41.2배(18,870÷458≈41.2) 늘었다.

3단계: 네 지표로 부상성 평가하기

  • 입력: 토픽별 문서 임베딩과 방법 태그, 시점별 새 문서 수
  • 처리: 새로움, 성장, 응집, 불확실성 계산 후 토픽 유형 분류
  • 산출: 토픽마다의 지표값과 부상 유형

네 지표는 기술 예측 문헌을 바탕으로 정의했다. 지표마다 전제와 계산 방식은 다음과 같다.

  1. 새로움: 부상 토픽에는 새 패러다임을 알리는 새 문서가 많을 것이라는 전제다. 문서 임베딩에 국소 이상치 계수(Local Outlier Factor, LOF)를 적용하고 토픽마다 평균을 낸다.
  2. 성장: 부상 토픽은 학계와 산업의 관심이 늘어 빨리 커질 것이라는 전제다. 현재 시점과 이전 시점의 새 문서 수 비율에 로그를 취한다.
  3. 응집: 부상 토픽은 내용에 일정한 일관성과 독립성이 있을 것이라는 전제다. 임베딩 공간에서 구성 문서와 토픽 중심 사이의 평균 거리로 정의한다.
  4. 불확실성: 부상 토픽은 굳은 개념보다 변화 가능성이 큰 혁신 쪽에 가까울 것이라는 전제다. 토픽 안 방법 태그의 분포에 섀넌 엔트로피를 적용한다.

LOF는 한 점 주변의 밀도를 이웃 점들의 밀도와 비교하는 비지도 이상치 탐지 방법이다. LOF 값이 높은 문서는 밀도가 낮은 자리에 있으면서 주변은 밀집 군집에 둘러싸여 있다. 그래서 이상치, 곧 새로운 문서일 가능성이 크다. 이웃 수 k는 반기마다 문서 수의 1%를 내림한 값으로 정했다. 문서가 늘어도 탐지 기준이 시점마다 균형 있게 유지되도록 k를 문서 수에 비례해 바꾼 것이다.

성장 지표는 두 시점의 새 문서 수가 같으면 0이 되고, 늘면 양수, 줄면 음수가 된다. 불확실성은 토픽 안에서 쓰인 방법이 여러 가지일수록 높고, 방법이 표준화될수록 낮다. 예를 들어 2024년 상반기 부상 토픽 가운데 ETA-LM의 불확실성은 3.7542, GBL-TM은 3.1622다. ETA-LM 문서에서 쓰는 방법 태그가 더 넓게 퍼져 있다는 뜻이다.

논문은 피인용 같은 영향력 지표를 쓰지 않았다. 이런 지표는 대개 뒤늦게 나타나는 후행 지표이기 때문이다.

지표를 구한 뒤에는 모든 시점의 토픽을 네 지표로 다시 군집화해 유형을 나눈다. 군집 수 2~10 범위에서 K-평균을 돌리고 팔꿈치 지점으로 최적 군집 수를 정했다. 유형별 해석 기준은 다음과 같다.

  • 부상(emerging): 새로움, 성장, 응집, 불확실성이 모두 높다.
  • 부상 후(post-emerging): 새로움은 높지만 성장이 느리고, 응집이 강하며, 불확실성이 낮다.
  • 부상 전(pre-emerging): 새로움은 낮지만 성장이나 불확실성이 높은 군집은 부상 전 잠재력을 나타낼 수 있다.
  • 주변(marginal): 어느 지표에서도 두드러지지 않는다.

사례에서는 주변 317개, 부상 전 350개, 부상 후 32개, 부상 93개 토픽이 나왔다. 모두 317+350+32+93=792개다.

4단계: 토픽 진화 맵 만들기

  • 입력: 시점별 토픽과 토픽 사이에 함께 속한 논문 수
  • 처리: 앞뒤 시점 토픽을 공유 논문으로 연결하고 유형 전환을 해석
  • 산출: 목표 토픽의 선행·후속 경로를 보여 주는 대화형 맵

처리 순서는 다음과 같다.

  1. 시점 T의 목표 토픽과 논문을 공유하는 직전 시점의 토픽을 선행 토픽으로 정한다.
  2. 시점 T+1에서 목표 토픽과 논문을 공유하는 토픽을 후속 토픽으로 정한다.
  3. 시각화를 간결하게 하려고 공유 논문이 둘 이상인 연결만 표시한다.
  4. 연결된 토픽들의 부상 유형을 함께 읽어 기술 수명주기에서 어디쯤인지 해석한다.

토픽마다 유형이 있으므로, 유형이 바뀌는 방향에 뜻이 생긴다. 논문이 제시한 해석은 다음과 같다.

  • 부상 전 → 부상: 기술이 태동기에서 성장기로 옮겨 갔을 수 있다.
  • 부상 → 부상 후: 성장 정점을 지나 성숙기로 들어갔을 수 있다.
  • 주변 → 부상 전 또는 부상: 덜 다뤄지던 주변 영역의 초기 잠재력을 반영할 수 있다.
  • 부상 전 → 부상 후: 하이프 사이클을 빠르게 지나갔을 수 있다.
  • 부상 → 주변: 기술이 낡아 가는 신호일 수 있다.

결과: 그래프 트랜스포머, 특정 언어 모델링, 효율적 트랜스포머가 부상 토픽으로 나왔다

네 유형의 지표 평균

첫째 연구 질문에 답하려고 논문은 모든 시점의 토픽을 네 유형으로 나누고 유형마다 지표 평균을 냈다. 논문 표 3에서 눈에 띄는 값은 다음과 같다.

  • 부상 후 유형은 평균 새로움 1.1346, 평균 응집 0.8260으로 두 값 모두 네 유형 가운데 가장 크다.
  • 평균 성장은 부상 유형 1.3055, 부상 전 유형 0.3927이다.
  • 평균 불확실성은 부상 후 유형이 3.1928로 네 유형 가운데 가장 낮다.

논문은 부상 후 유형을 하나의 통일된 패러다임으로 굳어진 기술로 설명하고, 그 근거로 높은 응집을 든다. 평균 불확실성이 가장 낮다는 점까지 이 설명과 연결해 읽는 것은 논문이 아니라 필자의 해석이다.

부상 유형의 대표 토픽 세 개

논문은 부상 유형이 가까운 미래의 AI 지형에 가장 큰 영향을 줄 수 있다고 보고, 2024년 상반기 부상 토픽의 핵심 논문을 정리했다.

그림 2. 2024년 상반기 부상 토픽 세 개는 모두 부상 전 유형 평균보다 빠르게 성장했다.
  • 24H1_25, 트랜스포머 기반 그래프 학습(GBL-TM): 새로움 1.0345, 성장 1.0678, 응집 0.7471, 불확실성 3.1622다. 정보 네트워크, 그래프 마이닝, 분자 표현 같은 과제에 쓰는 그래프 트랜스포머를 다룬다. 분자 특성 예측에 선 그래프 트랜스포머를 쓴 연구, 추천 시스템의 사용자–아이템 상호작용을 이질 부분그래프 트랜스포머로 모델링한 연구가 들어 있다. 최근에는 지식 그래프, 시계열, 멀티모달 데이터로 범위가 넓어졌다.
  • 24H1_2, 저자원·특정 언어 모델링(LM-LRSL): 새로움 1.0647, 성장 1.3863, 응집 0.7523, 불확실성 3.3756이다. PLM을 특정 언어의 자연어 처리 과제에 적용한다. 러시아어 유해 표현 순화, 이탈리아어 시 BERT 모델 검증, 미낭카바우어 감성 분석·번역 말뭉치, 에스토니아어 다국어 BERT 평가 연구가 포함된다.
  • 24H1_15, 언어 모델링용 효율적 트랜스포머(ETA-LM): 새로움 1.0732, 성장 0.9445, 응집 0.6608, 불확실성 3.7542다. 옵티마이저, 배치 학습, 어텐션 연산을 다시 다룬다. 대형 배치 최적화 기법 LAMB는 BERT 학습 시간을 사흘에서 76분으로 줄였다. Primer는 학습을 최대 4배 빠르게 했다. 협업 멀티헤드 어텐션은 키·쿼리 투영 크기를 4분의 1로 줄이면서 정확도와 속도를 유지했다.

다른 유형의 예도 있다. 주변 유형의 24H1_7(이미지·영상 처리용 특징 표현 학습)은 2024년 상반기에 가장 큰 토픽이었다. 부상 전 유형의 24H1_104는 로봇 시스템에 트랜스포머를 적용한다. 부상 후 유형의 24H1_47은 다국어 PLM의 교차언어 이해를 다룬다. 새 과제가 관심을 유지하지만 방법이 표준화되면서 기세가 느려졌다.

진화 경로: 지식 집약 자연어 처리 토픽

둘째 연구 질문에 답하려고 논문은 2020년 상반기의 부상 토픽 20H1_21(‘Transformers for Knowledge-Intensive NLP’)을 목표로 정했다. 이 토픽에는 GPT-3처럼 대형 언어모델 발전을 이끈 연구가 들어 있다. 검색 증강 생성(Retrieval-Augmented Generation, RAG), ColBERT, DeBERTa처럼 지식 활용과 검색 기반 기법도 들어 있다.

선행 토픽은 셋이다.

  • 19H1_5(부상 전): GPT-1과 BERT처럼 트랜스포머 구조로 PLM을 도입한 논문과 Transformer-XL이 속한다.
  • 19H1_12(부상): Universal Transformer, Music Transformer, 상식 추론 데이터셋 HellaSwag 같은 트랜스포머 응용이 속한다.
  • 19H2_28(부상 전): 위 두 토픽에서 나왔고, 사전학습 연구와 트랜스포머 응용을 함께 다룬다.

목표 토픽은 2020년 하반기에 후속 토픽 다섯으로 나뉘었다.

  • 20H2_6(부상 전): PLM의 강건성과 전이성을 다루며, 다음 반기에 21H1_46(부상 전)으로 이어졌다.
  • 20H2_17(주변): 개체 매칭, 관계 추출 같은 과제에 PLM을 쓰며, 다음 반기에 세 토픽으로 나뉘었다.
  • 20H2_26(부상 전): 자연어 처리 응용과 실무·윤리 고려를 다룬다. 다음 반기의 도메인 적응 PLM 토픽이 주로 이 토픽에서 나왔다.
  • 20H3_36(주변): 효율적 학습 기법을 다룬다. 다음 반기에 효율적 어텐션 토픽 21H1_58(부상 전) 등으로 나뉘었다.
  • 20H2_39(부상 전): 데이터별 트랜스포머 변형을 다룬다. 다음 반기에 어텐션 계산 효율 토픽 21H1_8과 도메인 응용 토픽 21H1_27로 나뉘었다.

논문은 이 맵으로 목표 토픽의 선행·후속 경로를 보였다. 그리고 이를 바탕으로 GPT-3, RAG, ColBERT, DeBERTa 같은 기술의 발전을 해석했다. 트랜스포머 사전학습에서 도메인 특화 언어 모델링과 어텐션 효율화로 이어지는 흐름이다.

기존 토픽 모델과의 비교

논문은 제안 방법을 다음 세 방법과 비교했다.

  • LDA
  • BERTopic
  • 사전학습 BERT에 K-평균을 붙인 방법

평가 지표는 세 측면으로 나뉜다.

  • 토픽 일관성: C_v, UMass, 정규화 점별 상호정보량
  • 군집 품질: 실루엣 점수, 칼린스키-하라바스 지수, 데이비스-볼딘 지수
  • 계산 효율: 에포크당 시간

어느 한 모델이 모든 지표에서 앞서지는 않았다. 논문은 제안 방법이 토픽 일관성, 군집 품질, 계산 효율 세 측면 모두에서 2위라고 서술했다. 한 기준에서 1위는 아니지만 모든 기준에서 균형 잡힌 성능을 낸다는 것이 논문의 해석이다. 다만 이 순위는 논문의 주장이고, 논문 표 6의 개별 지표로 보면 순위가 지표마다 다를 수 있다. 예를 들어 토픽 일관성 지표 C_v는 BERTopic이 0.5560으로 제안 방법의 0.4894보다 높다. 계산 시간도 BERTopic이 제안 방법보다 짧았다.

같은 K-평균을 쓴 일반 BERT와 비교하면 제안 방법의 C_v와 칼린스키-하라바스 지수가 더 높다. 논문은 도메인 적응으로 더 학습하면 임베딩의 의미 일관성이 높아져 토픽이 더 잘 나뉜다고 설명한다. 표 6의 차이는 이 설명과 맞아떨어진다. 다만 논문이 표 6의 차이를 이 원인으로 따로 검증하지는 않았다.

의의와 한계

무엇이 달라지는가

  • 학술지 중심 데이터베이스 대신 PapersWithCode의 텍스트, 태그, 메타데이터를 CLR 자료원으로 활용할 가능성을 보였다.
  • 반년마다 다시 학습한 AI 특화 PLM으로 토픽을 찾아 바뀌는 AI 용어를 반영했다.
  • 과거를 돌아보는 분석에 더해 새로움, 성장, 응집, 불확실성 네 지표로 부상성을 계산하는 재현 가능한 틀을 제시했다.
  • 공유 논문으로 토픽을 잇고 부상 유형의 전환을 함께 읽어 기술 수명주기를 해석하는 방법을 제시했다.

실무자에게 주는 쓸모

논문은 PLM으로 전문 문헌을 대량으로 처리하므로 AI 연구 동향을 시간과 비용을 덜 들여 넓게 살필 수 있다고 본다. 부상 토픽에 관한 결과는 AI 도입과 활용을 정하는 관리자와 정책 담당자의 의사결정에 쓸 수 있다. 소스 코드는 https://github.com/jm-chung/AI-CLR 에 공개되어 있다.

논문은 실무 적용 지침도 남겼다. 새 자료원을 쓸 때는 신뢰성, 적시성, 도메인 관련성, 접근성을 평가하라고 권한다. AI 전문가 13명(박사 5명, 대학원생 8명)의 평가를 정리한 표 5에서 PapersWithCode는 신뢰성 중간, 적시성 꽤 높음(Moderately High), 도메인 관련성과 접근성 높음을 받았다. 그런데 논문 본문은 전문가들이 PapersWithCode를 높은 신뢰성과 도메인 관련성을 갖춘 가장 포괄적이고 우수한 자료로 꼽았다고 서술한다. 신뢰성에 대한 표 5의 값과 본문 서술이 서로 다르므로, 이 평가를 인용할 때는 두 곳을 함께 확인하는 편이 좋다. 방법 태그가 없는 자료라면 개체명 인식으로 방법 이름을 뽑아 불확실성을 비슷하게 계산할 수 있다.

연구자에게 주는 쓸모

논문은 빠르게 바뀌는 AI 지형을 살피는 체계적인 절차를 제공한다. 사례는 어텐션이었지만 핵심 논문의 선정만 바꾸면 컴퓨터 비전, 음성 처리, 로보틱스, 강화학습, 생성형 AI에도 적용할 수 있다고 밝혔다. 부상성 지표 넷은 기술 예측 문헌에서 가져온 것이므로, 다른 분야의 신흥 기술 연구와 지표를 비교해 볼 여지도 있다.

논문이 밝힌 한계

논문이 스스로 밝힌 한계는 다섯 가지다.

  • 언어 모델링을 더 개선해야 한다. 자기부호화 방식 밖의 모델, GPT-4나 Claude 같은 대형 언어모델, 지식 그래프, RAG를 검토할 수 있다.
  • 부상성 지표의 사후(事後) 검증이 필요하다. 토픽의 영향력은 뉴스, 소셜 미디어, 인용 네트워크 등으로 시간을 두고 따로 살펴야 한다.
  • 토픽 맵은 문서 유사도로 만든 토픽을 공유 문서로 이을 뿐이다. 개체 단위 토픽과 논문 사이의 인용 관계를 반영해야 한다.
  • 어텐션 사례 하나만 분석했다. 외적 타당성을 확보하려면 다른 AI 하위 주제로 더 시험해야 한다.
  • PapersWithCode 자료에는 학술대회 논문 중심 구성, 영어 아닌 문헌 제외 같은 편향이 있을 수 있다.

필자가 보는 적용 조건

아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.

  • 문서마다 방법 태그나 그에 준하는 구조화된 항목이 있어야 불확실성 지표를 논문 방식대로 구할 수 있다. 태그가 없으면 추출 작업의 품질이 지표 품질을 좌우한다.
  • 응집은 중심과의 평균 거리로 정의된다. 자기 자료에서는 값이 클 때와 작을 때를 어떻게 읽을지 먼저 정해 두는 편이 안전하다.
  • 네 지표와 유형 구분은 같은 자료 안에서의 상대 비교다. 다른 데이터셋이나 다른 주제의 지표값을 그대로 맞대어 비교하면 해석이 어긋날 수 있다.
  • 반년마다 언어모델을 다시 학습하려면 GPU 자원과 시간이 든다. 감시 주기와 예산을 먼저 정해야 한다.
  • 자료원의 제공 방식은 바뀔 수 있다. 수집할 때마다 기준 시점을 기록해 두어야 결과를 다시 만들 수 있다.

바로 해 볼 일

  • 관심 분야에서 방법 태그나 키워드 하나를 정하고, 해당 논문의 제목과 초록을 모은다. 그다음 논문처럼 반년 단위로 누적한 묶음으로 나누어, 반기별 문서 수가 어떻게 늘었는지부터 확인한다.
  • 언어모델 학습 전에, 이미 가진 임베딩과 K-평균으로 반기별 군집을 만든다. 군집마다 성장(새 문서 수 비율의 로그)과 불확실성(방법 태그 분포의 섀넌 엔트로피)을 구해 본다. 이 두 지표만으로도 어떤 군집이 커지고 있고 방법이 아직 정해지지 않았는지 감을 잡을 수 있다.
  • 이웃한 두 반기의 군집을 공유 논문 수로 연결하고, 공유 논문이 둘 이상인 연결만 남겨 본다. 관심 군집 하나를 정해 선행 군집과 후속 군집의 대표 논문을 읽으면 그 주제가 어디서 왔고 어디로 나뉘었는지 정리할 수 있다.

비즈니스인텔리전스랩은 문헌과 특허 데이터로 기술 흐름을 읽는 방법을 계속 소개한다. 다음 글에서도 논문 한 편을 같은 방식으로 풀어 본다.

키워드

함께 읽을 글