경쟁사가 다음에 어떤 상품과 서비스를 내놓을지 알고 싶은 기획 담당자는 대개 전문가 의견에 의존한다. 제품, 기업, 고객의 관계가 복잡해지고 제품 수명이 짧아지면서 전문가 중심 분석에 드는 시간과 노력이 커졌다. 특허나 소셜 미디어를 분석하는 방법도 있다. 다만 결과가 키워드 묶음으로 나오기 때문에, 그 묶음을 실제 사업으로 해석하는 데 다시 많은 노력이 든다.
그렇다면 상표에 적힌 상품·서비스 이름을 언어모델로 벡터로 바꾸고, 다른 사업과 동떨어진 지점을 이상치 탐지로 찾으면 새 사업 기회를 미리 알아볼 수 있을까?
이 질문에 답한 논문을 한 편 읽어 본다.
- 제목: Identification of emerging business areas for business opportunity analysis: An approach based on language model and local outlier factor
- 학술지: Computers in Industry
- 연도: 2022
- DOI: 10.1016/j.compind.2022.103677
연구진은 언어모델과 국소 이상치 계수(Local Outlier Factor, LOF)를 함께 쓰는 방법을 제안했다. 언어모델은 뜻이 비슷한 상품·서비스를 묶어 사업 영역을 정의한다. LOF는 각 사업 영역이 얼마나 새로운지를 수치로 측정한다. 마지막 단계에서는 새로운 영역을 최신성과 가시성 기준으로 배치한 사업기회 맵을 만든다.
글 전체에서 쓸 용어는 다음과 같다.
- 지정상품·서비스(designated goods and services, G&S) 문장: 상표를 출원할 때 그 상표를 붙일 상품과 서비스를 적은 문장이다.
- 사업 항목(business item): G&S 문장을 구분자로 나눈 상품·서비스 이름 하나다.
- 사업 영역(business area): 뜻이 비슷한 사업 항목을 묶은 군집이다.
- 신규성(novelty): 사업 항목이 기존 상품·서비스와 표현 방식에서 얼마나 다른지를 나타낸다.
- 최신성(recency)과 가시성(visibility): 최신성은 사업 영역이 얼마나 최근에 나타났는지, 가시성은 사업 영역이 얼마나 자주 보이는지를 뜻한다.
- 탐색 범위(business landscape): 사업 기회를 찾을 대상 자료의 범위다.
동기: 사업 영역이 얼마나 새로운지를 수치로 측정한 연구가 드물었다
왜 신흥 사업 영역을 일찍 찾아야 하는가
논문이 든 이유는 다음과 같다.
- 사업 환경의 불확실성과 변동성이 커지면서 사업 기회를 발견하는 일이 더 중요해졌다.
- 신흥 사업 영역은 잠재 사업 기회의 초기 지표다. 새 사업 전략을 짜고 가까운 미래의 사업 환경을 내다보는 데 핵심이 된다.
- 전문가 의견에만 의존하는 기존 분석은 시간과 노동이 많이 든다. 그래서 관리자와 실무자가 데이터 중심 접근을 점점 더 많이 쓴다.
- 성공한 혁신은 높은 신규성과 관련이 깊다. 따라서 새로운 상품·서비스로 이루어진 영역부터 찾는 것이 합리적이다.
연구진이 상표를 자료로 택한 이유도 여기에 있다. 기업은 진행 중인 사업의 출처를 표시하려고 상표를 출원한다. 곧 시작할 새 사업 영역을 알리고 선점하려는 목적으로도 출원한다. 상표는 상품과 서비스를 표준화된 형식으로 적기 때문에 계산 방법을 적용하기에도 좋다.
기존 연구가 다루지 않은 부분
기존 연구가 사업 기회를 찾을 때 쓴 자료는 네 종류다.
- 특허: 기술 개발이나 기술 사업화 단계의 기회를 보여 준다.
- 웹 뉴스와 소셜 미디어: 미래에 관한 내용이나 출시 뒤 고객 반응을 다룬다.
- 창업기업의 사업 계획: 초기 사업 아이디어의 단서가 된다.
대부분의 연구는 세 단계를 밟는다. 탐색 범위를 정하고, 사업 영역을 나누고, 기회를 평가한다. 논문은 각 단계에서 다음과 같은 빈틈을 짚었다.
- 탐색 범위: 특정 기술이나 제품에 관한 자료를 연구자가 선택해 모으므로 범위의 경계가 분명하지 않다. 검색식을 정교하게 만들어도 현장에서 같은 결과를 다시 얻기 어렵다.
- 사업 영역 정의: 영역을 몇 개로 어떻게 나눌지 정해 둔 기준이 없다. 같은 범위를 분석해도 연구자의 방법이나 판단에 따라 영역이 다르게 정의된다. 잠재 디리클레 할당(Latent Dirichlet Allocation, LDA) 같은 토픽 모델링은 키워드 묶음을 내놓는데, 이 묶음을 실제 사업으로 해석하기 어렵다.
- 기회 평가: 성장, 인기, 가시성은 분석해 왔다. 반면 사업 영역의 신규성을 수치로 나타내는 방법은 거의 다루지 않았다.
- 자료의 시점: 기존 자료는 기술 개발 단계나 출시 뒤 시장 단계에 가깝다. 사업 운영 단계에 가까운 상표 자료는 쓰이지 않았다.
방법: 상표 속 상품명을 벡터로 바꾸고, 밀집에서 벗어난 영역을 LOF로 찾는다
방법은 네 단계로 이루어진다. 1단계에서 탐색 범위를 정하고 상표 자료를 모아 정리한다. 2단계에서 G&S 문장을 사업 항목으로 나누고, 언어모델로 벡터를 만든 뒤 군집으로 묶어 사업 영역을 정의한다. 3단계에서 사업 영역마다 LOF로 신규성을 계산하고, 4단계에서 최신성과 가시성을 더해 사업기회 맵을 만든다. 이 글도 논문과 같은 네 단계로 나누어 설명한다.
사례와 자료
자료원은 미국 특허상표청(United States Patent and Trademark Office, USPTO) 데이터베이스다. USPTO는 1870년부터 상표를 관리해 왔다. 법적 사건, G&S 문장, 분류 코드 같은 상세 정보를 전자 형식으로 검색할 수 있다. 연구진은 세 가지 정보를 썼다.
- 니스 분류(Nice Classification, NCL) 코드: 상품과 서비스를 45개 류로 나누며, 탐색 범위를 좁히는 데 썼다.
- 출원 시점: 사업 운영의 시기를 파악하는 데 썼다.
- G&S 문장: 구체적인 사업 항목을 뽑아 사업 영역을 정의하는 데 썼다.
사례는 과학·연구용 기기와 장치를 다루는 NCL 09류다. 이 류에는 기술 집약 제품이 많다. 가상현실 기기, 리튬이온 배터리, 블루투스 스마트 기기, 인공지능 응용, 암호화폐 관련 상표가 꾸준히 늘고 있다. 2019년 상표 통계 보고서에서도 NCL 09는 출원이 꾸준히 늘어나는 범위로 나타났다.
분석 대상은 NCL 09류로 출원된 상표 134,898건과 그 G&S 문장이다. 분석 기간은 분석 당시 이용할 수 있던 가장 최근 자료인 2017년 초부터 2018년 말까지다.
1단계: 자료 수집과 전처리
- 입력: USPTO 상표 원자료
- 처리: 탐색 범위를 정하고 상표를 모은 뒤 구문 분석해 저장
- 산출: 정형 항목과 비정형 항목이 함께 든 상표 데이터베이스
- 탐색 범위를 정한다. 특정 키워드가 든 상표로 좁게 정할 수도 있고, NCL 코드 하나에 해당하는 상표 전체로 넓게 정할 수도 있다.
- 정한 기준으로 USPTO에서 상표를 모은다.
- 원자료를 구문 분석해 데이터베이스에 저장한다. NCL 코드와 출원번호는 정형 항목으로, 상표명과 G&S 문장은 비정형 항목으로 저장한다.
범위를 먼저 정하는 데는 이유가 있다. 신규성과 신흥성은 다른 영역과 비교해야 정해지는 상대 개념이기 때문이다. 사례에서는 NCL 09류 전체를 범위로 정했고, 그 결과 134,898건을 모았다.
2단계: 사업 항목 추출과 사업 영역 정의
- 입력: 상표마다 적힌 G&S 문장
- 처리: 문장 정제, 항목 추출, 언어모델 벡터화, 군집화
- 산출: 뜻이 비슷한 사업 항목으로 이루어진 사업 영역
USPTO는 상품·서비스의 일반 명칭을 담은 상표 식별 매뉴얼(Trademark Identification Manual)을 제공한다. 그런데 출원인 상당수는 자기 상품을 차별화하려고 새로운 표현을 쓴다. 표현이 다른 사업 항목이 너무 많아 사람이 하나씩 분석할 수 없으므로, 아래 네 하위 단계를 거친다.
- 문장 정제: G&S 문장에 섞인 법적 절차 표현을 지운다. 예를 들어 “(Based on 44(e) Priority Application) Smart phones; Television receivers; Monitors for computers; Commercial monitors”에서 괄호 안의 우선권 정보를 지운다.
- 항목 추출: 구분자로 문장을 나눈다. 위 문장은 smart phones, television receiver, monitors for computers, commercial monitors 네 항목이 된다.
- 벡터 표현: 사전학습 언어모델로 각 항목을 n차원 벡터로 바꾼다. 뜻이나 표현이 비슷한 항목은 벡터 공간에서 가까이 놓인다.
- 군집화: k-평균(k-means) 같은 비지도 군집 방법으로 비슷한 항목을 묶는다. 각 군집이 사업 영역이 된다. 영역의 뜻은 군집 중심점에 가까운 항목을 보고 해석한다.
단어 주머니(Bag-of-Words, BoW) 방식을 쓰지 않은 이유도 있다. BoW는 단어 하나를 차원 하나로 삼기 때문에 고유 단어가 수천 개를 넘으면 차원의 저주(차원이 너무 많아 계산이 어려워지는 문제)를 겪는다. 단어 순서와 문맥도 버리므로 같은 단어가 다르게 배열된 표현을 구분하기 어렵다.
사례에서는 G&S 문장에서 사업 항목 254,063개를 추출했다. 연구진은 두 기준으로 항목을 추렸다.
- 문서 빈도(Document Frequency, DF)가 1인 항목, 곧 상표 한 건에만 나온 항목을 지웠다.
- 상표 식별 매뉴얼에 없는 항목만 남겼다. 매뉴얼에 없는 항목일수록 차별화된 상품·서비스일 가능성이 높기 때문이다.
남은 항목은 73,048개다. 연구진은 RoBERTa 모델로 이 항목을 1,024차원 벡터로 바꾸고 k-평균으로 묶었다. 영역 수는 관성(inertia) 값을 참고해 전문가가 판단해 정했다. 영역 수에 따라 사업 기회의 구체성이 달라지기 때문이다.
3단계: 사업 영역의 신규성 평가
- 입력: 사업 영역마다 구한 중심 벡터
- 처리: 중심 벡터에 LOF 계산
- 산출: 사업 영역마다 신규성 값
분석 단위는 사업 영역이다. LOF에는 각 영역을 이루는 항목 벡터로 계산한 중심값을 넣는다. LOF는 주변 이웃과 비교해 대상이 얼마나 고립되어 있는지를 계산한다. 계산 순서는 다음과 같다.
- k-거리: 대상 p에서 k번째로 가까운 이웃까지의 유클리드 거리를 구한다.
- 도달 거리: p와 이웃 o 사이의 도달 거리는 ‘o의 k-거리’와 ‘p와 o의 실제 거리’ 가운데 큰 값이다.
- 국소 도달 밀도(local reachability density, lrd): p에서 이웃까지 도달 거리가 평균적으로 짧을수록 커진다.
- LOF: 이웃의 평균 밀도를 p의 밀도로 나눈다.
LOF 값이 1에 가까우면 p의 밀도가 이웃과 비슷하므로 정상 지점이다. 1보다 크면 p가 이웃보다 성긴 곳에 있으므로 이상치일 가능성이 높다. 논문은 세 경우를 들어 설명한다.
- p가 빽빽한 곳 한가운데 있으면 p와 이웃의 밀도가 모두 커서 LOF가 작다.
- p가 성긴 곳 한가운데 있으면 둘 다 밀도가 작아서 LOF가 작다.
- p는 성긴 곳에 있는데 이웃이 빽빽한 군집을 이루면 LOF가 크다. 이 경우가 이상치다.
예를 하나 본다. 논문 표 2에서 ‘모노포드’ 영역의 신규성 값은 1.366이다. 논문은 신규성 값이 LOF 기반이라고만 설명한다. 다른 영역의 값은 원문 표 2에서 확인할 수 있다.
거리 기반 군집 대신 밀도를 보는 데도 이유가 있다. 상품 이름은 임베딩 공간에서 거리가 가까워도 단어 하나가 바뀌면 큰 기술 발전을 나타낼 수 있다. 그래서 거리만으로는 새로움을 판단하기 어렵다.
이웃 수 k는 전문가가 정한다. 사례에서는 전문가 의견에 따라 이웃 수를 20으로 정했다. 그 결과 사업 영역 103개가 신규 영역으로 나왔다.
4단계: 사업기회 맵 작성
- 입력: 신규 사업 영역과 그 영역에 속한 상표의 출원 시점·빈도
- 처리: 최신성과 가시성을 계산해 2차원 평면에 배치
- 산출: 네 영역으로 나뉜 사업기회 맵
새로운 영역이라도 빠르게 성장하는지 함께 봐야 기회의 가능성이 커진다. 그래서 연구진은 최신성과 가시성을 더했다.
- 최신성을 계산한다. 최신성은 사업 영역이 상표에 얼마나 최근에 나타났는지를 뜻하며, 등장 시점으로 측정한다.
- 가시성을 계산한다. 가시성은 사업 영역이 탐색 범위 안에서 얼마나 두드러지는지를 뜻하며, 빈도로 측정한다.
- 맵에 배치한다. 신규 영역 하나가 점 하나다. 점 크기는 신규성, 가로 좌표는 최신성, 세로 좌표는 가시성이다.
- 정규화한 최신성과 가시성의 평균값을 경계로 삼아 네 영역으로 나눈다.
네 영역의 뜻은 다음과 같다.
- 신흥 영역(최신성 높음, 가시성 높음): 최근에 나타났는데도 이미 흐름을 이끄는 영역으로, 가장 가치 있는 기회다.
- 신흥 이후 영역(최신성 낮음, 가시성 높음): 영향력은 크지만 포화될 가능성이 있다. 틈새시장 기회를 찾으려면 자세히 조사해야 한다.
- 주변 영역(최신성 낮음, 가시성 낮음): 오래 관찰되었고 비중도 작다. 큰 혁신이 없으면 기회에서 뺄 수 있다.
- 신흥 이전 영역(최신성 높음, 가시성 낮음): 새로 나타났지만 아직 건수가 적어 계속 관찰해야 한다.
사례에서 ‘스마트 워치(745)’ 영역은 신흥 영역에 들었다. 영역별 신규성·최신성·가시성 값은 논문 표 3에 정리되어 있으니 원문을 보면 된다. 논문에 평균 경계값 자체는 나오지 않는다. 다만 신흥 영역으로 분류되었으므로, 두 좌표가 모두 평균 경계보다 높았다고 필자는 추론한다.
변형과 시나리오
설정과 분석 목적에 따라 결과가 달라진다.
- 이웃 수 k: 새 영역을 넓게 탐색하는 기업은 k를 크게 잡는다. 그러면 인접 영역을 더 많이 고려하게 되어 거시적인 결과를 얻는다. 점진 혁신에 관심 있는 기업은 범위를 인접 영역으로 좁힌다.
- 사업 영역 수: 영역 수는 사업 기회가 얼마나 구체적으로 나오는지에 직접 영향을 준다.
- 자사 영역 제외: 이미 자사가 운영하는 영역은 맵에서 뺀다. 전문가가 특정 영역을 분석에서 빼면 LOF와 지표를 다시 계산해 배치해야 한다.
- 시점: 맵은 분석 시점의 단면이다. 실무에서 쓰려면 자료와 결과를 계속 갱신해야 한다.
- 거리와 이상치 탐지 방법: 자료에 따라 다른 거리 측정이나 이상치 탐지 방법으로 바꿀 수 있다.
결과: 신규 영역 103개 가운데 16개가 신흥 영역이었고, 이 영역의 출원인 수가 뚜렷이 많았다
신규 사업 영역 103개
LOF 계산으로 신규 영역 103개가 나왔다. 논문이 예로 든 영역은 다음과 같다.
- 모노포드
- 블루투스 통신기기
- 착용형 로봇 슈트(robot exoskeleton suits)
- 리튬이온 배터리
두 영역만 자세히 보면 다음과 같다. 모노포드 영역은 스마트폰과 카메라용 셀카봉, 휴대용 모노포드로 이루어진다. 리튬이온 배터리 영역은 리튬이온 폴리머 전지로 이루어진다. 두 영역의 신규성 값은 논문 표 2에 있다.
신규 영역이라는 말은 임베딩 공간에서 이 영역이 다른 영역과 표현이 떨어져 있다는 뜻이다. 셀카봉이나 블루투스 스피커처럼 지금은 흔해 보이는 상품이 들어 있는 데는 이유가 있다. 신규성은 같은 탐색 범위 안의 다른 영역과 비교한 상대값이다. 게다가 분석 자료는 2017년 초부터 2018년 말까지의 상표다. 따라서 이 결과는 그 시점의 NCL 09류 안에서 상대적으로 새로웠다는 뜻으로 읽어야 한다.
사업기회 맵의 네 영역
연구진은 신규 영역 103개마다 상표를 찾아 최신성과 가시성을 계산했다. 네 영역에 든 영역 수는 아래와 같고, 합계는 103개다(16+33+40+14=103).
| 맵 영역 | 영역 수 | 다음 행동 |
|---|---|---|
| 신흥 | 16 | 선발 기업·경쟁자 조사 |
| 신흥 이전 | 33 | 계속 관찰 |
| 주변 | 40 | 대부분 분석에서 제외 |
| 신흥 이후 | 14 | 포화 여부 점검 |
출처: 논문 4.2절 본문
신흥 영역에서는 다음 영역이 기회 가능성이 높은 신규 영역으로 꼽혔다.
- 암호화 소프트웨어(687)
- 스마트 워치(745)
- 인공지능 소프트웨어(662)
신흥 이전 영역에는 다음 영역이 들었다. 이 영역은 가시성 신호가 약해 계속 관찰해야 한다.
- 리튬이온 배터리(719)
- 착용형 로봇 슈트(948)
- 음성 제어 스마트홈 기기(991)
- 셀프 계산대(988)
리튬이온 배터리는 신규 영역으로 꼽혔지만 신흥 이전 영역에 놓였다. 맵에서 신규성은 좌표가 아니라 점 크기로만 쓰이기 때문이다.
정량 검증: 신흥 영역과 신흥 이전 영역의 출원인 수 비교
연구진은 신흥 영역과 신흥 이전 영역의 출원인 수를 비교했다. 어떤 영역에서 활동하는 주체(커뮤니티)가 많을수록 신흥성이 높다는 선행 연구를 따른 것이다. 신흥 이전 영역을 비교 집단으로 삼은 이유는, 이 영역이 앞으로 신흥 영역으로 자랄 가능성이 가장 높지만 아직 신흥성을 갖추지 않았기 때문이다. 검정은 표본 크기와 분산이 서로 다른 두 집단의 양측 t검정이다. 귀무가설은 두 집단의 평균이 같다는 것이다.
결과는 논문 표 4에 있다. 신흥 영역 16개의 평균 출원인 수가 신흥 이전 영역 33개보다 크게 높았다. 신흥 영역 안에서도 영역마다 출원인 수의 편차가 컸다. 집단별 평균과 표준편차는 원문 표 4를 보면 된다.
검정 통계량은 t=5.11이다. t는 두 평균의 차이를 표준오차로 나눈 값이다. 논문은 p를 0.000으로 적었다. 반올림한 값이 0으로 표시될 만큼 작다는 뜻이다.
논문의 해석과 필자의 평가는 구분해서 읽어야 한다. 연구진은 이 결과가 제안 방법이 신흥 영역을 찾아낸다는 주장을 대략 뒷받침한다고 해석했다. 다만 이 비교는 독립 검증이 아니다. 두 집단은 처음부터 가시성, 곧 상표 빈도를 기준으로 나뉘었다. 상표가 많은 영역은 출원인도 많기 쉽다. 따라서 이 비교는 가시성으로 나눈 집단 사이의 차이를 다시 확인한 것에 가깝고, 방법의 결과와 일관된 경향이 나타났다는 정도로 읽는 것이 적절하다.
정성 검증: 이후 기업 활동 추적
연구진은 숫자 비교만으로는 방법의 품질을 증명할 수 없다고 보았다. 그래서 신흥 영역에 있던 주요 기업이 이후에 어떻게 활동했는지 추적했다. 이 추적은 방법이 기업 활동을 예측했다는 증거가 아니다. 분석 뒤의 기업 활동이 결과와 어긋나지 않는지 사후에 확인한 것이다.
- 태양광 발전 패널 영역도 신규성, 최신성, 가시성 세 지표 모두에서 신흥 영역으로 나왔다. 앞의 세 영역은 논문이 맵 결과에서 대표로 꼽은 예이고, 태양광 패널은 검증 부분에서 따로 든 신흥 영역의 예다. 논문은 이 영역과 관련이 깊은 한화큐셀이 인수합병을 이어 가며 태양광 사업을 키웠고, 기존 패널보다 효율을 높인 기술을 출시했다고 서술한다.
- 암호화 소프트웨어 영역에서는 HashiCorp가 중앙 키 관리로 민감 데이터를 보호하는 암호화 솔루션의 주요 기업이 되었다. 논문은 이 영역에 초기에 관여했던 Tencent와 Tessian이 지금은 고객에게 데이터 보안·암호화 사업을 제공하고 있다고 서술한다.
- 논문은 신흥 이전 영역의 리튬이온 배터리, 스마트홈 기기, 셀프 계산대가 이후 여러 제품과 서비스에 꼭 필요한 부분이 되었다고 서술한다. 논문에 따르면 리튬이온 배터리 시장은 전기차 확산과 스마트폰·웨어러블 수요로 커졌다. 스마트홈 기기 시장은 사물인터넷 기기가 늘면서 빠르게 성장했다. 셀프 계산대는 키오스크 형태로 비대면 소비 수요와 함께 커졌다.
신흥성은 대개 뒤늦게 판단되기 때문에, 얼마나 신흥한지를 정하는 일은 어렵고 주관이 개입하기 쉽다.
의의와 한계
무엇이 달라지는가
- 자료: 사업 기회 발견 분야에서 상표 G&S 문장에 텍스트 마이닝을 적용한 첫 시도다.
- 결과의 단위: 분석 결과가 키워드 수준에서 사업 항목, 곧 상품·서비스 수준으로 구체화되었다.
- 지표: 기존 연구가 거의 다루지 않던 사업 영역의 신규성을 LOF로 수치화했다.
- 시점: 기술 개발이나 시장 예측 단계에 머물던 분석을 사업 운영 초기 단계, 곧 상표 출원 시점 가까이로 옮겼다.
- 구조: 한 번 쓰고 끝나는 기존 방법을, 전문가가 단계마다 결과를 조정하고 해석하는 상호작용형 구조로 바꾸었다.
- 모형: 최신 사전학습 언어모델을 사업 기회 식별에 처음 적용한 연구에 속한다.
실무자에게 주는 쓸모
논문은 넓은 범위에서 사업 기회를 탐색할 수 있어 분석에 드는 시간과 노력을 크게 줄일 수 있을 것으로 기대한다. 다만 실제 절감 효과는 측정하지 않았다. 영역 수와 이웃 수 결정, 사업 항목 선정, 영역 해석에는 여전히 전문가가 개입한다.
결과가 키워드 묶음이 아니라 상품·서비스 목록으로 나와 의사결정에 바로 쓰기 쉽다. 절차가 체계적이어서 자동화 소프트웨어로 만들 수 있다. 데이터 분석 기술이 부족한 현업 전문가도 쓸 수 있다는 뜻이다.
탐색 범위를 정해 두면 새 상표 자료를 더하는 일도 간단하다. 새 상표의 G&S 문장을 찾아 탐색 범위를 다시 그리기만 하면 된다. 기존 방법과 함께 쓸 수도 있다. 예를 들어 신흥 영역을 찾은 뒤 소셜 미디어 분석으로 제품·시장·경쟁자를 살피면 기회를 더 구체화할 수 있다. 다만 결과가 실제 기회인지 판단하는 일은 여전히 전문가와 관리자의 몫이다.
연구자에게 주는 쓸모
- 기술 예측, 미래 신호 탐지, 경쟁 분석에도 이 방법을 쓸 수 있다.
- 특허, 뉴스, 과학 논문 같은 다른 자료원에 기법 몇 가지를 바꿔 적용할 수 있다.
- 특허와 상표를 연결한 데이터베이스를 쓰면 신흥 영역의 기반 기술과 경쟁사 기술을 함께 파악할 수 있다.
- 논문은 자료에 따라 거리 측정과 이상치 탐지 방법을 바꿔 써야 한다고 밝혔다.
논문이 밝힌 한계
논문이 스스로 밝힌 한계는 다섯 가지다.
- 신흥 가능성이 있는 영역을 찾을 뿐, 그 영역이 실제로 떠올랐는지에 대한 확정 답은 주지 못한다. 실제 신흥 여부를 보여 주는 후행 지표와 함께 써야 가치가 커진다.
- 찾아낸 기회를 시장, 기술, 고객 자료로 더 구체화하고 다듬어야 한다.
- 자료 건수나 임베딩 차원이 늘면 계산 복잡도가 커진다. 최신 기법을 도입해 개선할 여지도 있다.
- 사업 항목 선정과 영역 해석 같은 작업은 아직 전문가 판단에 맡겨져 있어 완전히 자동화되지 않는다.
- 사례 연구가 한 건뿐이고, 찾아낸 기회가 아직 입증되지 않아 성능과 쓸모를 충분히 확인하지 못했다.
필자가 보는 적용 조건
아래는 논문에 적힌 내용이 아니라 필자가 실무 적용을 염두에 두고 덧붙이는 조건이다.
- 자사가 실제로 진입할 수 있는 상품 범위와 탐색 범위가 맞아야 한다. 범위가 넓으면 결과의 대부분이 자사와 무관한 영역이 된다.
- 사업 영역 수와 이웃 수를 몇 가지로 바꿔 돌려 보고, 신흥 영역 목록이 얼마나 유지되는지 확인해야 한다. 목록이 크게 바뀌면 그 결과를 근거로 결정하기 어렵다.
- 상표를 적게 출원하는 업종에서는 영역마다 상표 건수가 적어 가시성 값이 불안정할 수 있다.
- 신흥 영역으로 나온 결과를 시장 자료나 고객 자료로 확인할 담당자와 절차를 미리 정해 두어야 한다.
바로 해 볼 일
- 자사 업종에 해당하는 NCL 류 하나를 정한다. 그 류의 최근 상표 G&S 문장을 모아 괄호 속 절차 표현을 지우고 세미콜론으로 나눈다. 그다음 문서 빈도 1인 항목과 상표 식별 매뉴얼에 있는 항목을 빼 보면, 차별화된 상품 표현이 얼마나 남는지 확인할 수 있다.
- 남은 항목을 사전학습 언어모델로 벡터로 바꾸고 k-평균으로 묶는다. 군집 중심점에 LOF를 계산해 1보다 뚜렷이 큰 영역부터 살펴본다.
- 신규 영역마다 상표의 출원 시점과 빈도로 최신성과 가시성을 구한다. 두 값의 평균을 경계로 네 영역에 나누고, 신흥 영역에 든 항목을 자사 기획 담당자와 함께 검토한다.