使用期間別の顧客体験から製品改善の方向を探る

顧客が製品を使用した期間別にレビューを分けると、使用初期と長期使用の段階で改善すべき点が別々に見えるのだろうか。スマートウォッチのレビューを順位ベースの動的IPAマップで分析した論文を読む。

韓国語の原文から翻訳しました。 韓国語の原文

同じレビュー文でも、誰が書いたかによって意味が異なります。「バッテリーが長持ちして、防水機能がよい。」というレビューを購入から一週間の顧客が書いたのであれば、新品が高い水準で動作しているという意味に近くなります。同じ文を1年使った顧客が書いたのであれば、長く使っても品質と性能が維持されるという意味に読めます。ところが、先行研究の大半は全期間のレビューをまとめて分析してきました。

使用初期には興味深かった機能が、長く使うほど不満の要素に変わることがあります。逆に、最初は関心を集めなかった機能が、長く使うほど満足できる要素になることもあります。では、顧客が製品を使った期間別にレビューを分けて分析すれば、使用初期と長期使用の段階のそれぞれで何を直すべきかを見つけられるのでしょうか。

この問いに答えた論文を一本読んでみます。

  • タイトル: Identification of Product Improvement Directions Through Customer Experience Analysis Considering Product Usage Period
  • 学術誌: Journal of the Korean Institute of Industrial Engineers (Vol. 50, No. 4, pp. 251-265)
  • 発行年: 2024
  • DOI: 10.7232/JKIIE.2024.50.4.251

論文が提案する方法は、レビューを顧客の製品使用期間別に分けます。次に、期間ごとに製品特徴に対する関心度と満足度を計算し、順位に変換します。最後に、その順位を期間別の重要度-パフォーマンス分析マップに配置し、特徴の位置がどのように動くかを追跡します。この記事全体で使う用語は次のとおりです。

  • 製品使用期間: 顧客が製品を購入した時点からレビューを書いた時点までの期間です。論文は、ショッピングサイトが表示する所有期間を使用期間と定義しました。
  • 製品特徴: 顧客がレビューで言及する製品の要素です。トピックモデリング(文書の集まりに潜むトピックを見つける手法)で抽出したトピック1つが、製品特徴1つになります。
  • 関心度(Importance): ある使用期間のレビューのうち、その特徴を扱った文書の割合です。
  • 満足度(Performance): その特徴を構成する単語の感情スコアを、単語の重みで合算した値です。
  • 動的IPAマップ(Dynamic IPA Map): 重要度-パフォーマンス分析(Importance-Performance Analysis, IPA)を使用期間ごとに繰り返して描いたマップです。

動機: レビューの投稿時点ではなく、顧客が使った期間を見るべき

なぜ使用期間別の顧客体験が重要なのか

論文は、顧客体験を、顧客が製品・サービス提供者と関係を維持している間に得るすべての体験の総和と定義しています。顧客体験は期待と実際の体験の相互作用で成り立ち、感情、認知、行動を含みます。論文がこの問題を重視する理由は次のとおりです。

  • 競争が激しくなり、製品ライフサイクルが短くなっています。企業は競争優位を保つために、イノベーションと新製品開発を続ける必要があります。
  • 新製品を開発するには、顧客が製品を使う理由と要求事項を知る必要があります。そのために顧客体験を分析し、反映しなければなりません。
  • 肯定的な顧客体験は、顧客と企業の関係を強化し、ロイヤルティを築きます。結果として、企業の収益性の向上につながります。
  • オンラインレビューは、製品を使う過程の総体的な顧客体験を反映しています。ある調査では、約73%のユーザーが、オンラインレビューが購買決定に相当な影響を与えると答えました。
  • 企業は限られた人的・物的資源を適切な領域に配分しなければなりません。そのため、追加の資源が必要な特徴と、すでに十分に機能している特徴を区別し、順位づけする必要があります。

既存研究が扱っていない部分

オンラインの顧客の声(Voice of Customer, VoC)で製品を改善しようとする先行研究は、大きく2種類あります。1つ目は、品質と顧客満足度の向上を狙った研究です。Kanoモデルで製品属性を分類した研究(Qi et al., 2016)、LDAで属性を抽出してIPAを行った研究(Bi et al., 2019)、LASSOとDecision Treeで満足要因を探した研究(Chen et al., 2020)がここに属します。

2つ目は、技術革新と市場機会の発掘を狙った研究です。VoCと特許データで工程・サプライチェーンまで考慮した研究(Purnama and Masruroh, 2023)があります。レビューと特許ポートフォリオを結びつけて品質機能展開(Quality Function Deployment, QFD)を拡張した研究(Trappey et al., 2018)もあります。論文が指摘する空白は3つです。

  • 大半の研究は、全期間のレビューをまとめて分析しました。そのため、顧客が製品を使ううちに変わっていく体験を反映できませんでした。
  • 大半の研究は、抽出した改善要素の優先順位を決めていません。
  • 大半の研究は、レビューの分析で製品の所有期間の情報を使っていません。レビューの投稿時点は使用期間を代弁しません。十分に使い込んだ後の成熟したレビューかもしれませんし、軽いレビューかもしれません。

論文は結論で、既存の動的分析が製品の発売日やレビューの投稿時点を基準にしていたと、あらためて整理しています。

方法: レビューを使用期間別に分け、順位で動的IPAマップを作る

論文は方法を4つの段階で説明しています。第1段階でレビューを収集して前処理します。第2段階でトピックモデリングにより製品特徴を抽出します。第3段階で使用期間別に関心度と満足度を計算して順位をつけ、第4段階でその順位から動的IPAマップを作って改善の方向を探ります。この記事も同じ4つの段階で説明します。

図 1. レビューを使用期間の4区間に分け、特徴別の関心度・満足度の順位で動的IPAマップを作る4段階の手順である。

事例とデータ

事例の製品は、2019年以降に発売されたスマートウォッチです。スマートウォッチにはスマートフォン連携、運動強度の測定、GPSなどの機能があります。また、開発・発売のサイクルが短く、この方法を適用するのに適していると論文は判断しました。対象は次の8種です。

  • Samsung Galaxy Watch4 Aluminum Smartwatch 40mm、44mm(2021年8月発売)
  • Fitbit Versa 2 Health & Fitness Smartwatch(2019年8月)、Sense Advanced Health Smartwatch(2022年8月)
  • Apple Watch Series 6 40mm、44mm Aluminum Case(2020年9月)
  • Apple Watch SE 1st Generation 40mm、44mm Aluminum Case(2020年9月)

レビューはショッピングサイトのBest Buyから収集しました。Best Buyは、レビューの投稿時点とあわせて、顧客が製品をどれだけの期間所有したかを表示します。研究チームは、2020年1月1日から2022年12月31日までに書かれたレビュー25,655件を集めました。

Ku, Lee, Yoon(2024)の論文は使用期間を4つの区間に分けており、区間ごとに割り当てられたレビュー数は次のとおりです。

  • 1か月未満使用した顧客のレビュー(Period 1)は10,615件です。
  • 1か月以上2か月未満使用した顧客のレビュー(Period 2)は9,362件です。
  • 2か月以上6か月未満使用した顧客のレビュー(Period 3)は3,584件です。
  • 6か月以上1年未満使用した顧客のレビュー(Period 4)は1,483件です。

使用期間が長くなるほど、レビューは急速に減ります。Period 4のレビューはPeriod 1の約14%です(1,483÷10,615=14%)。

第1段階: レビューの収集と前処理

  • 入力: 使用期間がわかるオンライン製品レビュー
  • 処理: 収集、短いレビューとストップワードの除去
  • 出力: 製品特徴の抽出に適した形に整えられたレビュー

処理の順序は次のとおりです。

  1. Webクローリングまたは Open API で、対象製品のレビューを収集します。
  2. 製品特徴と関係のないメーカー名、製品名、ショッピングサイト名を削除します。
  3. 空白と特殊文字を含めて70文字未満のレビューは、意味のある情報がないとみなして除外します。
  4. 絵文字、特殊文字、擬音語などのストップワードを削除します。
  5. レビューごとに使用期間を確認し、4つの区間のいずれかに振り分けます。

目的が製品特徴の抽出なので、特徴を識別できない文字とレビューを先に取り除きます。

第2段階: BERTopicによる製品特徴の抽出

  • 入力: 前処理済みのレビュー
  • 処理: BERTopicによるトピックモデリング、階層トピックの整理、製品特徴トピックの選定
  • 出力: 製品特徴11個と、各特徴の主要単語

論文は、長く使われてきた潜在的ディリクレ配分法(Latent Dirichlet Allocation, LDA)ではなく、BERTopicを選びました。LDAは計算の複雑度が高く、単語間の複雑な意味関係を捉えるのに限界があると論文は説明しています。LDAと比較した研究では、BERTopicはトピックの一貫性とトピックの多様性の面で、全般的により安定していて優れていると知られています。BERTopicの処理の順序は次のとおりです。

  1. 事前学習済み言語モデルBERT(Bidirectional Encoder Representations from Transformer)で、各文書をベクトルに変換します。
  2. Uniform Manifold Approximation Projectionでベクトルの次元を削減します。この手法は、データの局所的特徴と大域的特徴をあわせて保存します。
  3. Hierarchical Density-Based Spatial Clustering of Applications with Noiseで、似た文書をまとめます。
  4. クラスベースTF-IDF(class-based Term Frequency-Inverse Document Frequency, c-TF-IDF)で、トピックごとに主要単語を抽出します。

c-TF-IDFは、1つのトピックの中で単語がどれだけ重要かを示す値です。1つのトピックに属する文書をすべてつなげて1つの文書とみなして計算します。BERTopicは、全期間のグローバルトピックを先に見つけ、それをもとに時間ステップごとにトピック表現を作り直す、動的トピックモデリングにも対応しています。論文はこの機能を使用期間の区間に適用し、同じ「バッテリー」トピックでも、期間ごとに主要単語がどう変わるかを追跡します。

事例では、最大2つの連続した単語までをキーワードとして使いました。その結果、55個のトピックが得られ、階層的トピックモデリングでこれを19個の大トピックにまとめました。19個のうち、サービス、価格、感情を扱った8個を除き、製品特徴11個を残しました。11個の特徴は次のとおりです。

  • Battery(バッテリー)、Health care(ヘルスケア)、Screen(画面)、Waterproof(防水)
  • Color(色)、Connection stability(接続の安定性)、Protection(保護)、Setup(セットアップ)
  • Software(ソフトウェア)、Fall detection(転倒検知)、Hand washing(手洗い)

たとえば、防水特徴の上位キーワードは、water、waterproof、pool、water proof、proofです。

第3段階: 使用期間別の関心度と満足度の算出

  • 入力: 使用期間別のレビュー、トピック別の割り当て文書、期間別のトピック単語とc-TF-IDF値
  • 処理: 関心度の割合計算、文単位の感情分析、加重和による満足度計算、順位づけ
  • 出力: Period 1~3は11個、Period 4は9個の特徴の、関心度・満足度の値と順位

処理の順序は次のとおりです。

  1. 期間ごとに各特徴へ割り当てられた文書数を集計し、関心度を計算します。
  2. レビューを文単位に分け、語彙・ルールベースの感情分析ツールVADERで、文ごとに感情スコアをつけます。
  3. トピックを構成する単語ごとに、その単語を含む文の平均感情スコアを求めます。
  4. 単語別の平均感情スコアにc-TF-IDF値を掛けてすべて足すと、その期間の満足度になります。
  5. 期間ごとに、関心度と満足度に順位をつけます。

関心度の根拠は、顧客がレビューで言及する特徴が、使用期間中に重要だと考えた要素だという点です。長く使ううちに関心が薄れ、もう使わなくなる機能もあるため、言及量が関心の度合いを代弁すると論文は考えています。式で書くと、関心度は「期間pの文書のうち、トピックtに割り当てられた文書の割合」です。たとえば、Period 4での防水の関心度は2.750809%です。この値は、Period 4の文書のうち、防水トピックに割り当てられた文書の割合を表します。

満足度を文単位で計算する理由は、1つのレビューに複数の文があり、文ごとに異なる特徴を述べることがあるからです。また、同じトピックでも、期間ごとに構成単語と重みが変わるため、期間別の単語構成を反映する必要があります。防水を例にすると、waterのc-TF-IDF値は、Period 1で0.268、Period 2で0.252、Period 3で0.218、Period 4で0.268と変わります。

計算例を、防水のPeriod 1で見てみましょう。求める値は、Period 1における防水特徴の満足度です。使う数値は構成単語の重みで、water 0.268、waterproof 0.225、water proof 0.109などです。各重みに、その単語を含む文の平均感情スコアを掛けて足すと、1.093373になります。この値がPeriod 1の11個の特徴のうち5位であるという事実が、次の段階の入力になります。

Period 4では、pool、showerなどの単語が新たに現れました。期間によって、既存になかったキーワードが登場することもあるのです。

第4段階: 順位による動的IPAマップの構成

  • 入力: 期間別の関心度順位と満足度順位
  • 処理: 順位をIPAマトリクスにマッピングし、主要単語の変化を解釈
  • 出力: 期間別に集中すべき特徴と改善の方向

IPAは、顧客満足のために先に集中すべき領域と順位を決める方法です(Martilla and James, 1977)。論文が説明する4つの領域は次のとおりです。

  • A1: 標準的な水準の成果を達成した主要な強みです。追加の資源なしに現状を維持できます。
  • A2: 主要な弱みです。集中して直さなければ競争で後れを取りかねないため、追加の資源が必要です。
  • A3: 成果は低いものの重要性も低く、今は脅威ではありません。ただし、今後、副次的な弱みになる可能性があります。
  • A4: 副次的で重要でない強みです。不要な資源を減らし、ほかの領域に集中することを勧めます。

マトリクスの軸を決める既存の方法は2つあります。尺度中心の方法は、尺度の中央値を軸として使います。この方法では、特徴が1つの象限に集中し、優先順位をつけにくくなります。データ中心の方法は、スコアの平均や中央値を軸として使いますが、期間ごとに平均と中央値が変わり、軸を固定できません。

そこで論文は、スコアの代わりに順位でIPAを行います。順位を使うと軸が固定され、特徴が1つの象限に集中せず、各象限に分かれて位置します。研究チームは、使用期間によって変化する関心度順位と満足度順位をマッピングし、動的IPAマップを作りました。このうち、変化が一定または急激な4つの特徴(バッテリー、防水、ソフトウェア、保護)を選んで解釈し、主要キーワードの変化を活用して具体的な改善の方向を示しました。

結果: バッテリーは常に重要で、防水は6か月後に満足度が下がる

関心度: バッテリーとヘルスケアがずっと1位、2位

最初の比較は、使用期間の4つの区間における、11個の特徴の関心度です。関心度が高いほど、顧客がその特徴に関心を持っているという意味です。論文の表4で、バッテリーの関心度はPeriod 1で91.28641、Period 4で87.05502と、4つの区間すべてで1位でした。ヘルスケアは4つの区間すべてで2位でした。

バッテリーの文書の割合は、ほかのトピックより圧倒的に高い値です。バッテリーとヘルスケアは、使用期間を通じて、顧客が最も関心を持って言及する特徴です。表4で、転倒検知と手洗いはPeriod 1からPeriod 3まで10位と11位で、Period 4には値がありません。論文は、この2つの特徴を、使用期間が長くなるほど、顧客が徐々に言及しなくなり、関心を持たなくなる特徴と解釈しました。

満足度: 期間ごとに順位が大きく変わる特徴

2つ目の比較は、同じ区間の満足度です。満足度は、単語別の感情スコアをc-TF-IDFで加重和した値です。論文の表5の順位では、3つの特徴が互いに異なる方向に動きます。

図 2. 満足度順位で、バッテリーは着実に上がり(スコア自体は下がる)、防水は6か月後に下がり、ソフトウェアは1位になる。
  • バッテリー: 10位、8位、7位、5位と、着実に上がります。
  • 防水: 5位、5位、3位を経て、Period 4で8位に下がります。
  • ソフトウェア: 8位、9位、6位を経て、Period 4で1.655252となり1位になります。

筆者の見方では、全期間をまとめて分析すると、こうした異なる方向の動きが1つの値に埋もれてしまうおそれがあります。

バッテリー: 長く使うほど相対的な満足度が上がる

バッテリーは4つの区間すべてで関心度1位です。顧客がスマートウォッチで最も重要視する要素がバッテリーだという意味です。ところが、満足度順位はPeriod 3まで相対的に低く(10位、8位、7位)、Period 4で5位に上がりました。

論文は次のように解釈します。使用初期には、バッテリー以外の特徴が魅力的な要素として受け止められます。使用期間が長くなるにつれて、ほかの特徴に対する関心と満足度が下がり、バッテリー性能が相対的により高い満足をもたらします。順位が相対的な値であることもあわせて見る必要があります。バッテリーの満足度スコア自体は、0.931766から0.785576へ下がりました。同じ期間に、防水、セットアップ、保護のスコアは、バッテリーより大きく下がりました。また、Period 4には転倒検知と手洗いの値がないため、順位の対象が9個に減りました。バッテリーの順位が上がったことには、この2つの要因が合わせて作用しました。

論文が示す改善の方向は、企業が既存製品よりバッテリー性能が落ちないように研究開発を行うべきだというものです。

防水: 6か月後に満足度が下がり、シャワー関連の問題が原因と推定される

防水は常に関心度が5位以内に入り、6か月未満の間は高い満足度を維持しました。Period 1からPeriod 3まで満足度は1以上でしたが、Period 4では以前の値の半分にも満たない0.4276でした。満足度順位はPeriod 3の3位からPeriod 4の8位に下がり、関心度順位は5位から3位に上がりました。

原因は単語構成に求めました。Period 4の防水トピックには、pool(0.302)、water(0.268)、shower(0.206)に続いて、notice(0.076)、problem(0.074)などの単語が新たに現れました。論文は、これらの単語から、顧客がスマートウォッチを着けたままシャワーを浴びる過程で、防水機能に問題が生じたと推論しました。

改善の方向は2つあります。

  • 防水機能について、顧客の使用期間を考慮したアフターサービス体制を整えます。
  • 新製品を開発する際に、長期の防水性能を高める研究開発の方策を検討します。

ソフトウェアと保護: 長期ユーザーが満足する特徴

ソフトウェアは関心度がずっと低いままでした(9位、9位、9位、8位)。ところが、Period 4で満足度が1位に跳ね上がりました。Period 4の上位単語は、goal(0.437)、competition(0.366)、neat(0.359)、regret(0.293)などです。論文は、運動目標を設定して達成する機能や、知人と活動量を共有して競い合う機能に対する満足が、順位を押し上げたと解釈しました。

満足度に比べて関心が低いため、論文は、顧客がこの機能をより深く知って使えるよう、マーケティング戦略を立てることを提案しています。長く使うほど満足するソフトウェアなので、アップデートを提供し続けるべきだという提案もあわせて行いました。

保護(付録ではScratchと表記)は、使用初期には重要度も満足度も低い特徴でした。関心度の割合はPeriod 1の0.631068からPeriod 4の1.618123に上がり、満足度順位は9位から6位になりました。論文は、6か月を超えるにつれて、傷への言及と満足がともに増えたと見ています。これを根拠に、傷に関連する耐久性が、長期顧客を満足させる特徴だと解釈しました。

変化が小さい特徴: ヘルスケアと色

ヘルスケアはずっと関心度2位で、満足度も大きな変化なく上位(4位、3位、5位、4位)でした。論文は、この特徴が良好な性能を維持していると見ています。色は関心度が高くありませんでしたが、満足度順位は2位、1位、1位、2位でした。論文は、リストバンドを交換できる点が安定した満足をもたらしていると解釈しました。

意義と限界

何が変わるのか

論文が新たに行ったことは次のとおりです。

  • レビューの投稿時点や発売日ではなく、顧客の製品使用期間でレビューを分け、特徴別の関心度と満足度の変化を測定しました。
  • その結果、使用初期に関心を集めた機能、顧客が継続的に使う中核機能、使用後期に満足度が低い機能を区別しました。
  • 指標を順位に変えて、IPAマトリクスの軸を固定しました。既存の動的IPA研究では、期間ごとのデータ分布によって軸が変わっていました。
  • BERTopicの動的トピックモデリングで期間別の構成単語を比較し、関心度と満足度が変わった原因を探りました。

実務者にとっての有用性

論文は、使用期間別の顧客体験情報を、アフターサービス政策の策定やマーケティング戦略の策定に使えると考えています。防水の事例では使用期間を考慮したアフターサービス体制を、ソフトウェアの事例では機能を知らせるマーケティングを提案しました。固定された軸の上で、改善が必要な特徴と十分に機能している特徴が分かれるため、限られた資源をどこに使うかを決めるのにも役立ちます。大量のレビューを使うので、アンケートベースの方法より比較的速く、顧客のフィードバックと要求事項を見つけられます。

研究者にとっての有用性

研究者にとっては、ショッピングサイトが提供する所有期間の情報を、新たな分析軸として使う事例になります。論文は、この情報を顧客の製品使用の成熟度を代弁する指標と見ています。論文の設計には、順位で軸を固定する動的IPAがあります。また、c-TF-IDFの重みと文単位の感情スコアを組み合わせた満足度指標もあります。論文はスマートウォッチという1つの製品群だけを扱いました。筆者は、この設計をほかの製品群の研究に適用する方法も検討できると考えています。

論文が示す限界

論文自身が示す限界は4つです。

  • トピックのうち製品特徴トピックを選ぶ段階に、分析者の主観が入るおそれがあります。客観的な選定方法についての後続研究が必要です。
  • 使用期間が長いほどレビュー数が減るため、使用後期の指標が少数のレビューに偏るおそれがあります。
  • 1つの製品群に属する複数製品のレビューを合わせて分析しました。製品ごとに機能名称、素材、サイズが異なるため、個別の製品を分析すれば、より正確になります。
  • 使用期間別のレビューで、顧客体験を間接的に分析しました。体験の変化を直接見るには、顧客の製品使用の全サイクルを追跡する必要があります。

筆者が考える適用条件

以下は論文に書かれた内容ではなく、筆者が実務への適用を念頭に置いて付け加える条件です。

  • レビューごとに購入時点や所有期間がわかる必要があります。この情報がないチャネルでは、同じ方法で区間を分けられません。
  • 最後の区間のレビュー数を先に確認する必要があります。事例でも、Period 4のレビューは1,483件で最も少なくなっています。自社製品のレビューがはるかに少ない場合は、区間をより広く取るほうがよいでしょう。
  • 順位は相対的な値です。バッテリーのようにスコアが下がっても順位が上がることがあるため、順位と元のスコアをあわせて見る必要があります。
  • 接続の安定性のように、満足度順位がずっと下位(11位、11位、11位、9位)の特徴は、論文が個別には解釈していません。自社の分析では、こうした特徴も改善候補としてあわせて検討する価値があります。

すぐに試せること

  • 自社製品のレビューをダウンロードし、レビューごとに購入日または所有期間があるかを確認します。ある場合は、論文のように1か月未満、12か月、26か月、6か月~1年の4つの区間に分け、区間別のレビュー数を集計します。
  • 70文字未満のレビューと、製品名・ショッピングサイト名を削除した後、全レビューからトピックを抽出し、製品特徴トピックだけを残します。区間ごとに特徴別の文書の割合を計算すると、関心度の表ができます。
  • 関心度順位が大きく動いた特徴を1つ決め、区間別の上位単語を並べて比較します。防水の事例のshowerやproblemのように、後の区間で新たに現れた単語が、改善の方向を探る手がかりになります。

ビジネスインテリジェンスラボは、レビューや特許などの大量データで、製品と技術の機会を探る研究を紹介しています。次回以降の記事でも、論文を1本ずつ同じ方法で読み解いていきます。

キーワード

関連記事