本文目前只有韩文版。

웹 데이터 네트워크로 사회 이슈를 찾는 법

갑자기 관심이 몰린 사회 이슈와 그 시기를 어떻게 찾을까. 키워드 연결망의 구조 엔트로피와 영향 점수로 요소수 이슈를 찾아낸 논문을 읽는다.

정책 부서와 기업 전략팀은 매일 쏟아지는 기사와 게시글을 보며 지금 사회가 무엇에 주목하는지 판단해야 한다. 기사 수가 많은 주제부터 차례로 읽으면 목록 위쪽은 대개 모두가 이미 아는 오래된 문제가 차지한다. 담당자가 정말 알고 싶은 것은 이번 주에 갑자기 관심이 몰린 주제와 그 시점이다.

그렇다면 웹에 쌓인 글 속 단어들의 연결 관계를 네트워크로 분석해서, 사람들이 갑자기 주목한 사회 이슈와 그 발생 시기를 체계적으로 찾아낼 수 있을까?

이 질문에 답한 논문을 한 편 읽어 본다.

  • 제목: A Network Analysis Approach to Detecting Social Issues with Web-Based Data
  • 학술지: Applied Sciences
  • 연도: 2023
  • DOI: 10.3390/app13148516

논문은 웹 데이터로 키워드 네트워크를 만들어 사회 이슈를 탐지하는 방법을 제안한다. 방법은 다음 세 가지 일을 한다.

  • 네트워크 구조의 변화로 이슈가 생긴 시기를 찾는다.
  • 그 시기의 네트워크에서 이슈 후보를 뽑는다.
  • 후보 사이에 긴급도 순위를 매긴다.

이 글에서 쓰는 핵심 용어는 다음과 같다.

  • 키워드 동시출현 네트워크(keyword co-occurrence network): 키워드를 점(노드)으로, 함께 나온 두 키워드를 선(링크)으로 잇는다. 선의 가중치는 함께 나온 횟수다.
  • 연결 중심성(degree centrality): 한 노드에 붙은 연결의 수다.
  • 매개 중심성(betweenness centrality): 모든 노드 쌍 사이의 최단 경로에 그 노드나 링크가 몇 번 들어가는지를 나타낸다.
  • 네트워크 구조 엔트로피(network structure entropy): 네트워크가 구조적으로 질서 있는지 무질서한지를 나타내는 값이다.
  • 커뮤니티(community): 서로 촘촘히 연결되고 바깥과는 느슨하게 연결된 노드 묶음이다.
  • 영향 점수(impact score): 이슈 후보가 구조 엔트로피 변화에 얼마나 기여했는지를 나타내는 점수다.

동기: 이슈가 언제 생겼고 무엇이 급한지 숫자로 말하기 어렵다

왜 사회 이슈 탐지가 중요한가

논문은 이슈를 여러 개인과 집단의 이야기에서 형성되어 점점 관심이 모이는 특정 주제나 문제로 정의한다. 논문이 사회 이슈 탐지가 중요하다고 보는 이유는 세 가지다.

  • 경제, 정치, 산업 같은 여러 분야에서 수많은 이슈가 생긴다. 이런 이슈의 분석은 오래전부터 사회의 핵심 과제로 여겨졌다.
  • 이슈를 제대로 다루지 않으면 국가적 과제로 커져 큰 경제 손실을 낳을 수 있다. 논문은 기후변화, 식량 위기, 사이버보안을 예로 든다.
  • 이슈는 짧게 나타났다 사라지거나 시간이 갈수록 계속 나빠지는 식으로 변한다. 그래서 사회 전체의 모습을 시간에 따라 계속 모니터링해야 한다.

기존 연구가 다루지 않은 부분

웹 데이터로 사건과 이슈를 탐지한 기존 연구는 세 유형으로 나뉜다. 특징 기반 접근은 문서에서 뽑은 키워드, 해시태그, 시각, 위치 같은 특징을 쓴다. 토픽 모델 기반 접근은 잠재 디리클레 할당(Latent Dirichlet Allocation, LDA) 같은 확률 모형을 써서 각 토픽 분포를 하나의 사건으로 본다. 두 접근 모두 이슈의 수와 모니터링 기간 같은 매개변수를 미리 정해야 하는데, 이슈가 계속 변하므로 이 값을 미리 정하기 어렵다.

점진적(incremental) 접근은 기존 이슈와 새로 생기는 이슈를 함께 탐지해 이 문제를 다루었다. 그런데 이 접근을 쓴 연구 대부분은 비슷한 문서를 묶어 이슈나 사건으로 정의했다. 논문이 짚은 빈틈은 세 가지다.

  • 이슈 발생 시점을 정량적으로 제시하기 어렵다. 비슷한 문서 묶음을 이슈로 정의하면 문서가 충분히 쌓여야 중요한 이슈로 인식된다.
  • 문서 몇 건이 새 이슈로 묶일 때, 그 묶음이 사람들의 관심 집중에서 나왔는지 사소한 사건에서 나왔는지 분명하지 않다.
  • 긴급도나 중요도로 순위를 매기기 어렵다. 기존 연구는 이슈 식별에서 멈추거나 자주 나온 사건을 중요한 이슈로 제시했다. 이 방식에서는 여러 이슈를 계속 검토해야 해서 급한 이슈를 제때 찾기 어렵다.

논문은 이슈를 “사람들의 관심이 갑자기 몰린 주제”로 보고, 그 정의에 맞춰 시점과 순위를 함께 구하려 한다.

방법: 키워드 연결망의 구조 변화로 이슈 발생 기간과 순위를 찾는다

논문은 방법을 네 단계로 설명한다.

그림 1. 기간별 키워드 네트워크를 만들고, 엔트로피가 급감한 기간에서 이슈 후보 순위를 매기는 네 단계
  1. 웹 데이터를 모으고 전처리해 유효 키워드를 정한다.
  2. 기간마다 키워드 동시출현 네트워크를 만든다.
  3. 네트워크 구조 엔트로피로 구조 변화를 모니터링해 이슈가 생긴 기간을 찾는다.
  4. 그 기간에서 이슈 후보를 정의하고 우선순위를 매겨 가장 급한 이슈를 탐지한다.

이 글도 같은 네 단계로 설명한다.

사례와 자료

논문은 한국의 요소수(Diesel Exhaust Fluid, DEF) 문제를 사회 이슈 사례로 삼았다. 한국은 2021년 말에 요소수 부족 문제를 겪었다. 요소수는 현대 디젤 차량에서 유해한 질소산화물 배출을 줄이는 데 꼭 필요한 액체다. 환경부 자료에 따르면 요소수가 필요한 차량에는 승용차, 화물 트럭, 대중교통 버스가 포함되었다. 요소수가 없으면 이 차량은 운행할 수 없어서 화물 운송과 출퇴근에 차질이 생겼다.

자료는 한국언론진흥재단이 운영하는 뉴스 빅데이터 분석 서비스 빅카인즈(BIGKinds)에서 모았다.

  • 수집 범위: 지역 일간지와 전문지를 빼고 전국 일간지 11곳의 기사를 모았다.
  • 수집 건수: 기사 129,747건의 발행일, 매체, 제목을 모았다. 논문은 수집 기간을 ‘2021년 9월 1일부터 2021년 11월 31일까지’로 적었다. 11월은 30일까지 있으므로 이 표기는 날짜 오기로 보인다.
  • 본문: 빅카인즈는 기사 본문을 일부만 제공해서, 연구진이 웹 스크래핑으로 전문을 모았다.
  • 분석 대상: ‘요소수’가 언급된 기사 수가 2021년 11월 초부터 급증했다. 그래서 10월 25일부터 11월 14일까지 발행된 기사 23,925건을 분석에 썼다.

1단계: 웹 데이터 수집과 전처리

  • 입력: 사회 구성원이 만든 웹 데이터의 텍스트
  • 처리: 키워드 추출, 불용어 제거
  • 산출: 유효 키워드 목록
  1. 웹 데이터의 텍스트를 모은다. 웹 데이터는 실시간으로 생겨 다른 공개 데이터보다 빨리 갱신된다. 대부분의 웹 플랫폼이 공개 API를 제공해 모으기도 쉽고, API가 없어도 웹 크롤링으로 모을 수 있다.
  2. 텍스트에서 키워드를 추출한다.
  3. 분석에 맞지 않거나 너무 일반적인 키워드를 걸러 낸다. 이모티콘이나 의성어처럼 사회 모니터링에 맞지 않는 불용어를 뺀다.

사례에서는 빅카인즈가 기사마다 제공하는 키워드 데이터를 썼다. 이 데이터는 형태소 분석기와 한국어 사전으로 기사 제목과 본문에서 뽑은 명사 키워드 목록이다. 연구진은 아래 네 조건에 해당하는 키워드를 불용어로 뺐다.

  • 길이가 1인 키워드: “A”, “끝”
  • 숫자로 시작하는 키워드: “1181조”, “282.8%”
  • 한국어와 영어가 아닌 외국어 키워드: “ざるうどん”, “水火”
  • 의미가 없거나 너무 넓은 키워드: “B씨”, “내년”, “지난달”

그 결과 고유 키워드 234,975개에서 유효 키워드 155,609개가 남았다.

2단계: 기간별 키워드 동시출현 네트워크 구성

  • 입력: 유효 키워드, 문서의 발행일
  • 처리: 기간 설정, 동시출현 쌍 추출, 쌍 걸러 내기, 네트워크 구성
  • 산출: 기간마다 하나씩 만든 키워드 동시출현 네트워크
  1. 모니터링할 기간을 여러 개 정한다.
  2. 기간마다 키워드 동시출현 쌍을 찾는다. 전체 자료로 네트워크 하나를 만들지 않고 기간마다 따로 만든다. 이슈가 시간에 따라 변하므로 언제 무엇에 관심이 몰렸는지 보려면 기간별 비교가 필요하다.
  3. 문서 길이에 맞춰 동시출현 단위를 정한다. 마이크로블로그처럼 짧은 문서는 한 문서 안의 모든 키워드 조합을 쌍으로 삼는다. 뉴스처럼 긴 문서는 문단이나 문장 안의 조합만 쌍으로 삼는다. 긴 문서에서 모든 조합을 쓰면 쌍이 너무 많아져 해석이 어렵기 때문이다.
  4. 키워드를 노드로, 동시출현 여부를 링크로, 동시출현 횟수를 링크 가중치로 삼아 네트워크를 만든다.

사례의 기간 설정은 기사 수의 요일 패턴을 따랐다. 주말 기사가 평일보다 훨씬 적어서, 모든 기간이 토요일과 일요일을 포함하도록 기간 하나를 7일로 정했다. 10월 25일부터 11월 14일까지 서로 겹치는 기간 8개가 나왔다. 첫 기간은 10월 25일31일, 다섯째 기간은 11월 2일8일, 마지막 기간은 11월 8일~14일이다.

빅카인즈 키워드 데이터는 기사 한 건에 평균 99.2개의 키워드를 제공한다. 기사 안의 모든 키워드를 쌍으로 삼으면 데이터가 너무 많아진다. 그래서 연구진은 n-그램 개념을 바탕으로 동시출현 쌍을 정했다.

  • 기사 본문을 문장으로 나누고, 문장을 띄어쓰기 단위로 나눈다.
  • 나눈 단어에 유효 키워드를 대응시키고, 문장 안의 위치 번호(Index)를 매긴다.
  • 위치 번호 차이가 N 이하인 두 키워드를 쌍으로 삼는다. 연구진은 반복 실험으로 N을 5로 정했다.

예를 들어 한 문장에서 ‘요소수’가 위치 2에, ‘화물차’가 위치 6에 있으면 차이가 4이므로 두 키워드는 쌍이 된다. 위치 9에 있는 키워드와 ‘요소수’의 차이는 7이므로 쌍이 되지 않는다.

연구진은 파레토 법칙(80-20 법칙)도 적용했다. 동시출현 횟수가 너무 적은 쌍은 의미 있는 쌍일 가능성이 낮다. 그래서 기간마다 동시출현 횟수 상위 20%인 쌍, 곧 3회 이상 함께 나온 쌍만 남겼다. 남은 쌍은 기간마다 평균 26,418.5개였다. 첫 기간에는 27,387개, 셋째 기간에는 25,564개였다.

3단계: 이슈 발생 기간 식별

  • 입력: 기간별 키워드 동시출현 네트워크
  • 처리: 노드와 링크의 중심성 계산, 구조 엔트로피 계산, 기간 사이의 변화 모니터링
  • 산출: 이슈가 생긴 기간
  1. 네트워크마다 노드의 연결 중심성과 매개 중심성, 링크의 가중치와 매개 중심성을 구한다.
  2. 이 값으로 노드 구조 엔트로피와 링크 구조 엔트로피를 구하고, 두 값을 더해 네트워크 구조 엔트로피를 얻는다.
  3. 기간마다 값을 늘어놓고 엔트로피가 빠르게 줄어든 기간을 찾는다. 그 기간을 이슈가 생긴 기간으로 본다.

이 지표는 정보 엔트로피 개념에서 왔다. 엔트로피가 늘면 정보가 다양해져 체계가 무질서해지고, 엔트로피가 줄면 정보 다양성이 낮아져 체계가 질서를 띤다. 키워드 네트워크의 구조 엔트로피가 어느 기간에 빠르게 줄었다는 것은 이렇게 해석한다. 전에는 여러 주제가 비슷한 정도로 언급되다가, 그 기간에 특정 키워드 조합이 많이 언급되었다는 뜻이다. 링크가 갑자기 생기거나 가중치가 급증하면 네트워크 구조가 빠르게 바뀐다.

식은 노드 부분과 링크 부분으로 나뉜다.

  • 노드 부분: 노드 i의 비중 p_i는 그 노드의 연결 중심성을 전체 연결 중심성 합으로 나눈 값이다. 보정값 q_i는 1−(매개 중심성 최댓값−노드 i의 매개 중심성)이다. 이 두 값을 (p_i^q_i − p_i)/(1 − q_i + ε) 꼴로 계산해 모든 노드에서 더하고 부호를 바꾼다. ε은 0보다 큰 작은 값이다.
  • 링크 부분: 링크 j의 비중 p_j는 그 링크의 가중치를 전체 가중치 합으로 나눈 값이다. 보정값 q_j는 링크의 매개 중심성으로 같은 방식으로 구한다.
  • 네트워크 전체: 노드 구조 엔트로피와 링크 구조 엔트로피를 더한다.

일상어로 풀면 이렇다. 소수의 키워드와 링크에 연결이 몰릴수록 값이 줄어드는 방향으로 움직이고, 연결이 여러 곳에 퍼질수록 값이 늘어나는 방향으로 움직인다. 사례의 넷째 기간(10월 31일~11월 6일)으로 계산해 보면, 노드 구조 엔트로피 −9.0344와 링크 구조 엔트로피 −11.9087을 더한 −9.0344+(−11.9087)=−20.9431이 네트워크 구조 엔트로피다.

다섯째 기간(11월 2일~8일)에는 노드 구조 엔트로피가 −9.3711, 링크 구조 엔트로피가 −11.9329였고, 네트워크 구조 엔트로피는 −21.3039였다. 네트워크 구조 엔트로피가 넷째 기간 −20.9431에서 다섯째 기간 −21.3039로 내려간 것이다. 여덟 기간 전체의 값은 논문 표 6에 있다(Lee et al., Applied Sciences 2023, CC BY 4.0).

연구진은 이 값을 시간 순서로 시각화해 다섯째 기간(11월 2일~8일)에서 엔트로피가 빠르게 줄었다고 판단했다.

4단계: 이슈 후보 정의와 우선순위 산출

  • 입력: 이슈가 생긴 기간의 네트워크, 그 직전 기간의 네트워크
  • 처리: 커뮤니티 탐지, 커뮤니티별 영향 점수 계산
  • 산출: 이슈 후보 목록과 우선순위, 가장 급한 이슈
  1. 이슈가 생긴 기간의 네트워크에 커뮤니티 탐지 알고리즘을 적용한다. 키워드 네트워크에서 커뮤니티는 자주 함께 나오는 키워드끼리 모인 묶음이라 하나의 주제를 뜻한다. 그래서 추출한 커뮤니티를 이슈 후보로 정의한다.
  2. 커뮤니티마다 영향 점수를 계산한다. 엔트로피 식에 연결 중심성이 들어가므로, 낮던 키워드의 연결 중심성이 갑자기 오르면 엔트로피도 빠르게 바뀐다. 그래서 커뮤니티를 이루는 키워드의 연결 중심성 변화로 점수를 구한다.
  3. 영향 점수가 높은 후보를 가장 급한 이슈로 탐지한다. 점수가 높은 후보는 사회 구성원이 갑자기 주목한 주제이기 때문이다.

사례에서는 커뮤니티 탐지에 루뱅(Louvain) 방법을 썼다. 이 방법은 큰 네트워크에서 모듈성(modularity)이 높은 커뮤니티 구조를 빠르고 정확하게 찾는다. 모듈성은 커뮤니티 사이의 링크와 비교해 커뮤니티 안의 링크가 얼마나 촘촘한지를 나타낸다. 루뱅 방법은 두 단계를 되풀이한다.

  • 1단계: 노드마다 처음에는 자기만의 커뮤니티를 가진다. 노드를 이웃 커뮤니티로 옮겼을 때 모듈성이 가장 많이 늘어나는 곳으로 옮기고, 더 이상 늘지 않을 때까지 반복한다.
  • 2단계: 커뮤니티 하나를 노드 하나로 합쳐 새 네트워크를 만든다. 새 링크의 가중치는 원래 커뮤니티 사이 링크 가중치의 합이다.
  • 모듈성이 더 오르지 않을 때까지 두 단계를 반복한다.

영향 점수의 뜻은 “두 기간에 모두 있는 키워드의 연결 중심성 변화량 평균”이다.

  • 분자: 커뮤니티 안 키워드 가운데 이번 기간과 직전 기간에 모두 있는 키워드의 연결 중심성 변화량(이번 값−직전 값)을 더한다.
  • 분모: 두 기간에 모두 있는 키워드의 개수다.
  • 직전 기간에 없던 새 키워드는 분자와 분모 모두에서 빠진다.

1순위 커뮤니티의 키워드로 계산 방식을 보자. ‘요소수’의 연결 중심성은 넷째 기간 5116에서 다섯째 기간 11,039로 올라 변화량이 5923이다. ‘주입’은 128에서 167로 올라 변화량이 39다. 식의 구조만 보이려고 커뮤니티가 이 두 키워드로만 이루어졌다고 가정하면, 영향 점수는 (5923+39)÷2=2981이다. 이 값은 가정에 따른 단순 설명이며 실제 커뮤니티의 점수가 아니다.

키워드4번째 기간5번째 기간변화
요소수511611,0395923
주입12816739
완주426624
아톤산업32017
익산243410
화물차11154
집중단속307−23

출처: 논문 표 9 일부 발췌·재구성 (Lee et al., Applied Sciences 2023, CC BY 4.0). 값은 연결 중심성이다.

‘집중단속’처럼 연결 중심성이 줄어든 키워드는 점수를 낮춘다. 실제 커뮤니티의 점수는 이보다 훨씬 많은 키워드의 변화량을 함께 평균해서 나오므로, 위의 가정 예와 규모가 다르다.

결과: 엔트로피가 급감한 기간에서 요소수 이슈가 1순위로 나왔다

그림 2. 5번째 기간에 구조 엔트로피가 급감했고, 그 기간 후보 가운데 요소수 커뮤니티의 영향 점수가 가장 높았다

기간별 구조 엔트로피 비교

연구진은 8개 기간의 네트워크 구조 엔트로피를 비교해 다섯째 기간(11월 2일~8일)을 이슈가 생긴 기간으로 정의했다. 분석 구간 자체는 ‘요소수’ 언급 기사가 급증한 시점을 보고 정해졌다. 필자가 보기에는 엔트로피가 줄어든 다섯째 기간이 11월 초 급증 시기와 겹친다. 다만 이 겹침은 필자의 해석이며, 논문이 이 일치를 따로 확인했다는 서술은 없다. 논문은 결과를 정량 지표로 검증하지 않았다고도 밝혔다.

커뮤니티 탐지 결과

다섯째 기간 네트워크에는 키워드 19,152개가 있었다. 루뱅 방법은 이 네트워크에서 커뮤니티 342개를 찾았다. 커뮤니티 하나에 든 키워드 수는 다음과 같다.

  • 평균: 56개
  • 중앙값: 22개
  • 최댓값: 3341개
  • 최솟값: 10개

연구진은 이 342개 커뮤니티를 모두 그 기간의 이슈 후보로 정의했다.

이슈 후보의 영향 점수 순위

영향 점수가 높을수록 그 커뮤니티가 구조 엔트로피의 급변에 더 많이 기여했다는 뜻이다. 상위 세 후보는 다음과 같다.

커뮤니티키워드 수영향 점수주요 키워드
#8646194.1요소수, 고속버스, 디젤차량, 화물차
#421381.1내성균, 세균, 카바페넴, 항생제
#2768422.0진단서, 진통제, 처방전, 펜타닐

출처: 논문 표 8

커뮤니티 #86의 점수 194.1은 2위 81.1보다 194.1−81.1=113.0 높다. 연구진은 #86을 가장 급한 사회 이슈로 탐지했다. 논문 표 8과 본문 해설의 커뮤니티 번호가 일치하지 않아, 이 글은 표 8의 표기를 따랐다. 표 8 기준으로 #42는 항생제 내성 후보이고, #276은 펜타닐 후보다.

2위와 3위 후보의 내용은 이렇다.

  • #42 항생제 내성 후보(영향 점수 81.1): 보건복지부가 그 시기에 마련한 ‘제2차 국가 항생제 내성 관리 대책’과 관련된 이슈다. 논문은 한국의 인체 항생제 사용량이 OECD 국가 가운데 세 번째로 많다고 적었다.
  • #276 펜타닐 후보(영향 점수 22.0): 주요 키워드는 진단서, 진통제, 처방전, 치료목적, 펜타닐이다. 논문은 마약성 진통제 펜타닐의 과다 처방과 복용으로 관련자가 체포되어 당시 화제가 되었다고 서술한다.

1순위 이슈의 키워드 해석

커뮤니티 #86에는 ‘요소수’와 함께 ‘고속버스’, ‘디젤차량’, ‘화물차’, ‘천정부지’, ‘시장교란’이 들어 있다. 요소수 부족과 가격 급등으로 고속버스와 화물차 같은 차량이 멈추는 것이 이 이슈의 가장 큰 문제였다.

연결 중심성이 오른 키워드에는 ‘주입’, ‘완주’, ‘아톤산업’, ‘익산’이 있다. 논문은 이 키워드의 배경을 이렇게 서술한다. 익산에 있는 한 요소수 제조사가 완주군 등 지방자치단체와 협약을 맺고 그 지역에 요소수를 우선 공급했다. 논문은 이 제조사가 하루 양을 제한해 주민에게 적정 가격으로 요소수를 팔았고, 지역 산업 안정에 애쓴 것으로 칭찬받았다고 서술한다. 논문은 그 결과 이 제조사와 익산시, 완주군이 그 시기에 주목받았다고 서술한다. 이 내용은 논문의 서술이며, 필자가 따로 사실을 확인하지는 않았다.

빈도 기준과의 차이도 드러난다. 이 자료에서 가장 많이 언급된 키워드는 코로나19, 백신, 접종처럼 코로나19 대유행과 관련된 것이었다. 저자는 영향 점수가 이와 다른 주제, 곧 그 시기에 관심이 갑자기 몰린 주제를 적절히 가려냈다고 판단한다. 이 판단은 저자의 정성 판단이며, 정량 검증은 없다.

새 키워드로 본 이슈의 전개

영향 점수 계산에서 빠진 새 키워드는 이슈의 가까운 미래를 짐작하는 데 쓸 수 있다. 요소수 커뮤니티의 새 키워드는 두 묶음으로 나타났다.

  • 소방 관련 키워드: ‘울주소방서’, ‘광양소방서’가 새로 나타났다. 실제로 요소수 부족이 길어지면서 소방차와 구급차 운행이 제한되었다. 소방서 앞에 요소수를 몰래 두고 간 익명 기부자 같은 도움도 전국에서 나타났다.
  • 화물 운송 관련 키워드: ‘화물연대’, ‘화물차주’, ‘화물운송’이 새로 나타났다. 논문은 화물연대가 운행 중단의 피해가 노동자에게 넘어간다며 파업을 발표했다고 서술한다.

논문은 화물연대가 한 해에 두 차례 파업했을 때 10.4조 원의 경제 손실이 났다고 적었다. 연구진은 새 키워드를 모니터링하면 요소수 이슈가 화물연대 관련 사건으로 번져 추가 손실을 낳을 수 있음을 짐작할 수 있다고 보았다.

의의와 한계

무엇이 달라지는가

  • 이슈 내용을 보기 전에 네트워크 구조 변화로 이슈가 생긴 기간을 정량적으로 찾는다.
  • 이슈를 “갑자기 관심이 몰린 주제”로 정의하고, 그 정의에 맞춰 시점을 찾는다. 특정 주제의 빈도에 주로 기댄 기존 연구와 출발점이 다르다.
  • 빈도가 아니라 구조 변화에 대한 영향 점수로 이슈 후보의 순위를 매긴다.
  • 이슈의 발생 기간과 우선순위를 함께 제시한다.

실무자에게 주는 쓸모

정부와 기업은 문화, 경제, 산업, 기술 분야의 수많은 이슈를 한정된 자원으로 다뤄야 한다. 이 방법은 이슈가 생긴 기간의 후보 순위를 제시해 급한 이슈부터 차례로 또는 선택해서 대응하도록 돕는다. 연구진은 이 방법이 특정 분야에 치우치지 않아 사회 여러 분야의 의사결정에 쓸 수 있을 것으로 기대했다.

새 키워드 모니터링은 대응을 앞당기는 데 쓸 수 있다. 연구진은 이 방법이 이슈의 전개 방향을 짐작하게 해서 미래를 대비한 대응을 마련하는 데 도움이 된다고 적었다.

연구자에게 주는 쓸모

이슈의 정의와 특성에서 출발해 탐지 절차를 짠 사례다. 구조 엔트로피와 영향 점수는 중심성 지표로 계산하므로, 다른 키워드 네트워크 연구에 같은 틀을 옮겨 볼 수 있다. 논문은 앞으로의 과제로 정량 검증, 다른 나라 사례 연구, 이슈의 생애 전체 모니터링을 제시했다.

논문이 밝힌 한계

논문이 스스로 밝힌 한계는 세 가지다.

  • 결과를 정량 지표로 검증하는 방법을 제시하지 않았다. 요소수 이슈 등이 적절히 탐지되었다는 판단은 저자의 정성 판단이다. 정량 검증이 있어야 다른 연구와 탐지 성능도 비교할 수 있다.
  • 한국 웹 뉴스 데이터만 다뤘다. 다른 나라 사례 연구가 필요하고, 여러 나라 데이터를 함께 쓰면 공통 이슈나 세계 이슈도 찾을 수 있다.
  • 이슈의 생애 전체를 포착하지 못했다. 기간마다 후보를 추출하지 않아 비용 면에서는 유리하지만, 이슈의 탄생부터 소멸까지는 보지 못한다.

필자가 보는 적용 조건

아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.

  • 기간 길이와 겹침 간격은 자기 자료의 발행 주기를 보고 정해야 한다. 요일이나 월말에 글 수가 크게 출렁이면 기간마다 네트워크 크기가 달라져 엔트로피 비교가 흔들린다.
  • “빠르게 줄었다”는 판단 기준을 조직 안에서 미리 정해 두는 편이 좋다. 직전 기간 대비 변화량이 얼마 이상이면 경보를 낼지 정해 두어야 담당자가 바뀌어도 판단이 같다.
  • 결과의 질은 키워드 추출과 불용어 목록에 크게 좌우된다. 사내 문서나 고객 게시글처럼 빅카인즈 키워드 데이터가 없는 자료는 형태소 분석과 불용어 목록을 먼저 점검해야 한다.
  • 1순위 후보만 보지 말고 상위 몇 개 후보를 함께 검토하는 편이 안전하다. 커뮤니티 크기가 10개에서 3341개까지 차이 나므로, 점수와 함께 키워드 구성을 사람이 읽어야 한다.
  • 새 키워드는 점수에 들어가지 않으므로 별도 목록으로 관리해야 한다. 이슈가 번질 방향은 이 목록에서 먼저 보인다.

바로 해 볼 일

  • 자기 분야 뉴스나 게시글을 3주 정도 모아 7일 단위의 겹치는 기간으로 나눈다. 문장 안에서 위치 차이가 5 이내인 키워드 쌍을 집계하고, 3회 이상 나온 쌍으로 기간마다 네트워크를 만든다.
  • 기간별 네트워크에서 노드와 링크의 중심성을 구해 구조 엔트로피를 계산한다. 직전 기간 대비 변화량을 표로 정리해 값이 가장 크게 줄어든 기간을 찾는다.
  • 그 기간의 네트워크에 루뱅 방법을 적용해 커뮤니티를 나눈다. 커뮤니티마다 두 기간에 모두 있는 키워드의 연결 중심성 변화량 평균을 구해 순위를 매기고, 직전 기간에 없던 새 키워드는 따로 목록으로 적어 둔다.

비즈니스인텔리전스랩은 웹 데이터와 특허 데이터로 기술과 사회의 변화를 읽는 방법을 연구한다. 다른 논문 해설도 이 블로그에서 이어서 소개한다.

关键词

相关文章