営業データのクレンジングの実務|過去データの修正・統合・標準化を段階的に進める方法
SFAに数年分の案件が溜まったものの、同じ会社が何件も重複して登録されている、社名の表記がバラバラで検索に引っかからない、連絡先が古くてメールが届かない。こうした状態では、売上予測もターゲットリストも信用できません。この記事は、すでに荒れてしまった過去の営業情報やデータを、どこから手を付け、どの順で直すのかという「クレンジングの実務」に絞って解説します。
ここで扱うのは「新しいデータをきれいに入れる方法」ではなく、「既に荒れた過去データを分析に耐える状態へ直す作業」です。具体的には、修正・統合・標準化という3つの操作を段階的に進めます。データ整備の体系的な全体像は、親記事の営業データ活用前の情報整備を参照してください。本記事はそのうちクレンジングだけを深掘りします。
営業データのクレンジングとは|過去データを直す3つの操作
営業データのクレンジングとは、すでに溜まった過去データを、修正・統合・標準化の3操作で分析やレポートに耐える状態へ直す作業です。ここでいうクレンジングは「これから入るデータを荒れさせない入力ルール」とは目的が別です。入力ルールが「今後の汚れを止める予防」であるのに対し、クレンジングは「すでに付いた汚れを落とす治療」にあたります。入力ルールの設計は兄弟記事の営業データの入力ルール設計に委ね、本記事は過去データの直し方に集中します。3操作にはそれぞれ直す対象が決まっており、後述するとおり着手する順序にも理由があります。
修正|古い・誤った・欠損した値を直す
修正は、値そのものが古い・間違っている・空欄になっているレコードを正しい状態に直す操作です。営業データでは、退職して連絡がつかない担当者名、移転前の住所、部署異動で変わった役職、入力されないまま放置された業種や従業員数などが典型です。誤った値は「間違ったまま存在する」ため、空欄より発見が遅れやすく、リストや予測を静かに歪めます。値の正しさを外部の情報源や本人確認で裏取りしながら直していきます。
統合|重複レコードを1件にまとめる
統合は、同じ企業や担当者が複数レコードに分かれている状態を1件にまとめる操作です。ここで使う「名寄せ」とは、重複した顧客・企業データを1件に統合することを指します。展示会リストの取り込み、複数営業による個別登録、社名表記の違いによる別レコード化などで、同一企業が3件も4件も並ぶことは珍しくありません。統合では、どのレコードを親として残し、どの情報を引き継ぐかのルールが必要になります。
標準化|表記ゆれ・単位・区分を統一する
標準化は、同じ意味の値がバラバラの書き方で入っている状態をそろえる操作です。「株式会社マツリカ」「(株)マツリカ」「マツリカ」のような法人格の有無、全角と半角の混在、「東京都」と「東京」のような住所の粒度、フェーズ区分の呼び方の違いなどが対象です。表記が統一されていないと、集計時に同じ企業が別物として数えられ、検索やフィルタからも漏れます。標準化のルールを決めて機械的にそろえていきます。
「品質を定義する」「入力ルールを作る」との違い
クレンジングと混同しやすいのが「どのデータをそろえるべきかを決める(品質の定義)」と「新規入力を荒れさせないルールを作る」の2つです。品質の定義は「そもそも何を集め、何を分析に使うか」を決める上流の話で、兄弟記事の分析に必要な営業データの見極めで扱います。入力ルールは前述のとおり予防策です。本記事はこの2つを前提としたうえで、「すでにある過去データをどう直すか」という治療のフェーズだけを扱います。
荒れた営業データが受注に与える損失
荒れた営業データは、営業生産性の各項目を直接毀損します。マツリカでは営業生産性を「(商談数×受注率×単価)÷工数」として整理していますが、重複や表記ゆれ、古い連絡先は、このうち工数・受注率・意思決定の精度をそれぞれ削ります。たとえば同一企業が重複登録されていれば、別々の担当が同じ相手にアプローチして関係を悪化させ、集計もやり直しになります。以下では、どの汚れが式のどの項目を毀損するかを具体的に見ていきます。
重複・表記ゆれが工数を膨らませる
重複と表記ゆれは、直接「工数」を膨らませます。同一顧客が複数レコードに分かれていると、担当者が別々に架電・訪問し、二重アプローチで顧客の心証を下げます。集計の場面でも、社名表記がそろっていなければ手作業で名寄せしながら数え直すことになり、月次レポートのたびに同じ作業を繰り返します。データが荒れているほど、本来分析に使うべき時間が「データを整える時間」に食われていきます。
古い連絡先・欠損が受注率を下げる
古い連絡先や欠損値は「受注率」を下げます。退職済みの担当者に営業をかけ続けたり、すでにキーマンでなくなった相手に訪問したりすれば、確度の高い相手に割くべき時間を失います。メールアドレスが古ければ送信しても届かず、フォロー自体が成立しません。欠損した業種・規模の情報は、優先すべき相手の見極めを難しくし、確度の低い案件に工数が流れる原因になります。
不正確なデータが意思決定を誤らせる
不正確なデータは、レポートや予測の精度を通じて意思決定そのものを誤らせます。重複したまま集計すれば案件数は水増しされ、古い金額のまま残れば売上予測は実態とずれます。SFA/CRMのAI機能で次のアクションや受注確度を提示する仕組みも広がっていますが、こうしたAIの出力は入力データの品質に依存します。汚れた入力からは、もっともらしく見えて実態と合わない結果が出てきます。クレンジングは、AI活用の前提を整える作業でもあります。
着手前の棚卸し|過去データの4点点検
作業に入る前に「どこがどれだけ荒れているか」を点検すると、限られた工数を効く場所へ集中できます。多くのクレンジングプロジェクトが、現状把握を飛ばしていきなり修正を始め、想定以上の量に途中で頓挫します。点検の観点は、重複率・空欄率・最終更新日・出所とコンプライアンスの4つです。以下で、それぞれの数え方と判断の目安を説明します。
重複率|同一企業・担当が何件あるか
まず、同じ企業や担当がどれだけ重複しているかを数えます。社名やドメイン、電話番号でグルーピングし、2件以上に分かれているレコードの割合を出します。重複率が高いほど、後述する統合の作業量が大きくなり、放置したときの二重アプローチのリスクも高まります。全体の件数に対して重複がどの程度含まれるかを把握しておくと、統合にかける工数を見積もれます。
空欄・欠損率|分析に使う項目の未入力割合
次に、分析やリストに使う項目の空欄率を項目ごとに出します。すべての項目を対象にする必要はなく、優先すべきは実際に使う項目です。業種・従業員数・役職・確度など、レポートやターゲティングに使うキー項目の未入力割合を確認します。空欄率が高い項目は、修正・補完の対象として優先度が上がります。逆に、使っていない項目は無理に埋めず、そもそも収集をやめる判断も検討できます。
最終更新日|動いていないレコードの割合
レコードの最終更新日を見て、一定期間動いていないものの割合を確認します。たとえば3年以上更新されていない案件は、連絡先や担当者が変わっている可能性が高く、そのまま使うとリストの精度を下げます。古いレコードは修正・補完の候補であると同時に、活用の見込みが薄ければアーカイブや削除の対象にもなります。更新が止まっている期間ごとに件数を集計しておくと、対応方針を決めやすくなります。
出所とコンプライアンス上の要注意データ
最後に、各データがどこから来たかと、法令上の扱いに注意が必要なものを洗い出します。退職者の個人情報、取得経緯が不明な名刺データ、利用目的の同意範囲を超えて保持している連絡先などが対象です。個人情報は必要な範囲を超えて保持し続けないことが原則で、利用の見込みがないものは削除の判断が必要になります。削除の判断軸は「利用目的が残っているか」「保持の根拠があるか」で、迷う場合は法務・管理部門と基準をすり合わせます。全社的な統制の設計は兄弟記事のデータガバナンスに委ねますが、クレンジングの棚卸し段階でも要注意データの存在は把握しておきます。
過去データを段階的に直す実践ステップ
過去データは「範囲を絞る→統合→標準化→修正→維持」の順で直すと、二度手間を減らせます。順序に理由があり、重複を先に消しておかないと、後の表記統一や値の修正を重複分だけ無駄に繰り返すことになるためです。統合を先にして母数を減らしてから標準化・修正へ進むのが効率的です。最初の一歩は小さく、対象を1つのオブジェクト(顧客や案件など)・直近2年程度に絞って始めます。以下、各ステップの実務を説明します。
ステップ1|対象と範囲を絞る
いきなり全件を対象にせず、「実際に使うデータ」から範囲を絞ります。対象オブジェクトを1つに、期間を直近2年程度に限定し、分析やリストに使う主要項目だけに絞るのが現実的です。全件を一度に直そうとすると量に押し潰されて途中で止まりやすく、また使っていない古いレコードを直しても効果が出ません。範囲を絞って一巡させ、手順と基準を固めてから対象を広げます。
ステップ2|重複を統合する
範囲を決めたら、重複レコードを統合します。まず名寄せのキーを設計します。社名だけでは表記ゆれで取りこぼすため、会社名に加えてメールのドメインや電話番号、法人番号など複数の項目を組み合わせて重複を検出します。次に、統合時にどのレコードを親として残すかのルールを決めます。「最終更新日が新しいものを優先」「入力項目が多いものを残す」といった基準をあらかじめ文書化し、担当者の判断でぶれないようにします。統合前に必ずバックアップを取り、誤統合に備えます。
ステップ3|表記を標準化する
重複をまとめた後に、残ったレコードの表記をそろえます。標準化のルールを項目ごとに決めておくと、機械的に処理できます。社名は法人格(株式会社/(株))の扱いを統一し、全角・半角を寄せ、住所の粒度をそろえます。フェーズや確度の区分も、呼び方が複数あれば1つに集約します。表計算の関数や置換で一括処理できるものも多いため、ルールを先に確定させてから一気にそろえるのが効率的です。
ステップ4|古い・欠損値を修正・補完する
表記がそろったら、古い値や欠損を修正・補完します。自社に正しい情報がない項目は、外部の企業データベースやAIによる補完を検討します。ここで注意したいのは、外部DBやAIが返す組織図・担当者情報・企業分析などは、AIが推定・生成する情報を含むという点です。たとえば約560万社の企業データベースとAI企業分析を持つMazrica Targetのようなサービスでは、企業情報やAIが生成した組織図・人物情報を活用できます。ただしこうした情報は推定を含むため、重要な判断に使う値は最終的に人が裏取りする前提で扱います。補完はあくまで「候補を効率よく集める」手段と位置づけます。
ステップ5|バックアップと目視の最終確認
自動処理を終えたら、必ず抜き取りで目視確認します。統合・標準化・補完はまとめて処理できる反面、キー設計やルールが誤っていると大量のレコードを一括で壊すリスクがあります。作業前のバックアップを保持したうえで、統合されたレコードや補完された値をサンプリングして確認し、想定どおりに直っているかを検証します。問題があればルールを見直し、再処理します。この確認を省くと、きれいになったつもりで別の汚れを作り込むことになります。
手作業・ツール・外注の使い分け
クレンジングの手段は「対象データ量・繰り返し頻度・社内リソース」の3つで選びます。少量で一度きりなら表計算ソフトで十分ですが、繰り返す・大量になるほどSFA/CRMやデータ連携基盤での仕組み化が向き、専門性の要る大量補完は外注が選択肢になります。手段は排他ではなく、範囲を絞った初回は手作業、定着後は仕組み化、といった組み合わせも現実的です。以下で各手段の向く条件と限界を整理します。
表計算ソフトでできること|限界
Excelなどの表計算ソフトは、少量の重複除去や関数による表記統一に向いています。重複削除機能や置換、関数を使えば、数百件規模のクレンジングは手元で完結できます。一方で、大量データ・継続運用・多人数での同時編集には破綻しやすく、履歴管理も難しくなります。なお表計算ソフトも外部連携や拡張に対応しており「連携できない」わけではありませんが、名寄せや自動整形を繰り返し回す用途では、手作業の負荷が積み上がりやすい点が限界になります。
SFA/CRM・データ連携基盤で仕組み化する
繰り返し発生するクレンジングは、SFA/CRM(営業支援・顧客管理システム)やデータ連携基盤で仕組み化すると工数を抑えられます。重複検出や入力補完、外部サービスとの連携による自動整形を、その都度手作業でやらずに済みます。たとえば700以上のSaaS・AIとノーコード連携し、データの整形・加工を担うMazrica DataHubのようなデータ連携基盤では、複数システムに散ったデータをつなぎ、整形処理を自動で流せます。こうした基盤は特定のSFAに縛られず、他社SFA/CRMや単独でも利用できるものがあります。
外注・外部データベースサービスを使う
大量の最新化・補完で、社内に工数や専門性が足りない場合は外注が選択肢になります。数万件規模の連絡先更新や企業情報の付与を専門業者に任せると、短期間で精度を上げられます。判断軸は、補完の精度・保有データの鮮度・自社のSFA/CRMと接続できるかの3点です。特に接続性は重要で、納品されたデータを自社システムに取り込めなければ、運用に乗せる段階で手戻りが発生します。契約前に、成果物の形式と取り込み手順を確認しておきます。
一度で終わらせないための維持と再発防止
クレンジングは一度やって終わりにはなりません。担当者の異動や退職、企業の合併・移転は年単位で起き続けるため、放置すればデータは再び荒れます。維持は「定期的にクレンジングを回すこと」と「入力段階で新たな汚れを止めること」の両輪で成り立ちます。ただし入力段階の再発防止、つまり入力ルールの設計そのものは兄弟記事に委ね、ここでは維持の頻度と役割分担を扱います。以下で維持の実務を説明します。
定期クレンジングの頻度と対象
定期クレンジングは、動きのないレコードと重複の再点検を軸に組みます。頻度は運用規模やデータの変化速度によりますが、四半期ごとや半期ごとに、最終更新日が一定期間止まっているレコードと、新たに発生した重複を点検する形が回しやすい単位です。全件を毎回見直すのではなく、棚卸しの4観点のうち劣化しやすい重複率と最終更新日を重点的に監視し、閾値を超えたら是正します。
入力段階で汚れを止める
いくら定期的に直しても、入力段階で汚れ続ければ追いつきません。必須項目の設定、自由記述ではなく選択式の採用、外部データからの自動補完などで、入り口の汚れを減らします。ただし、どの項目を必須にするか、どこまで選択式にするかといった入力ルールの具体的な設計は、運用負荷とのバランスが論点になります。詳細は営業データの入力ルール設計を参照してください。クレンジングと入力ルールをセットで設計してはじめて、データはきれいな状態を保てます。
維持を回す体制と責任分担
維持を継続するには、誰が・いつ・どの基準でクレンジングを行うかを決めておく必要があります。担当者を明確にし、点検の頻度と判断基準を文書化しておかないと、担当者の退職とともに運用が止まります。少人数のチームでも、最小限の統合・削除ルールと点検スケジュールは決めておきます。組織横断でのデータの統制やルール整備は個々のチームだけでは完結しないため、全社的な枠組みはデータガバナンスの設計に受け渡します。
よくある失敗と回避策
クレンジングが頓挫するパターンは、おおむね決まっています。典型は「全件を一度に直そうとする」「ルールを決めずに個人判断で消す」「一度きりで満足して元に戻る」の3つです。自社が陥りやすい型を先に把握しておくと、着手の設計を誤りません。以下で各パターンの兆候と回避策を示します。
全件を一度に直そうとして止まる
最も多い失敗が、最初から全件を対象にして量に押し潰されるパターンです。数年分・全オブジェクトを一気に直そうとすると、途中で工数が尽き、中途半端な状態で放置されます。回避策は前述のステップ1のとおり、使うデータから範囲を絞ることです。直近2年・主要1オブジェクトで一巡させ、手順と基準を固めてから対象を広げれば、成果を出しながら進められます。
ルールを決めずに個人判断で消す
統合や削除のルールを決めないまま各自の判断で作業すると、残すべきレコードを消したり、統合の基準がばらついたりして、かえってデータの信頼性を損ないます。回避策は、統合時にどのレコードを残すか、どういう場合に削除するかを先に文書化することです。少人数のチームでも、最小限のルールは必須です。ルールがあれば作業を分担しても結果がそろい、後から経緯も追えます。
一度きりで満足して半年で元に戻る
初回のクレンジングで満足し、維持の仕組みを作らずに放置すると、半年から1年で元の荒れた状態に戻ります。入力が改善されず、定期点検もなければ、汚れは再び蓄積します。回避策は、入力段階の再発防止と定期実行をセットで設計することです。クレンジングを「一度のプロジェクト」ではなく「継続的な運用」と位置づけることが、投じた工数を無駄にしないための条件です。
まとめ
荒れた営業データを直すなら、「まず全件を直す」のではなく、直近2年・主要1オブジェクトに絞って「統合→標準化→修正」の順で一巡させることを最初の一歩にしてください。重複を先に消してから表記をそろえ、値を直す順序が、二度手間を減らします。着手前の棚卸しで重複率・空欄率・最終更新日・出所の4観点を点検しておけば、限られた工数を効く場所へ振り向けられます。
繰り返し荒れるようならSFA/CRMやデータ連携基盤での仕組み化を、大量の補完で社内リソースが足りないなら外注を、データ量と繰り返し頻度で判断します。そして、入力段階の再発防止と定期実行をセットにしなければ、クレンジングは一度で終わりません。データ整備の体系的な全体像は、親記事の営業データ活用前の情報整備を参照してください。クレンジングの手順を仕組みに落とし込む段階では、データ連携や整形の自動化に関する製品資料もあわせて検討すると、運用設計の参考になります。
よくある質問
Q 営業データのクレンジングはどのくらいの頻度で実施するのが理想ですか?
一律の正解はなく、データの変化速度で決めます。担当者の異動や企業情報の変化は年単位で起きるため、多くの場合は四半期ごとや半期ごとに、重複と最終更新日を重点的に点検する形が回しやすい単位です。初回のクレンジング後は、全件を毎回見直すのではなく、劣化しやすい観点だけを定期監視し、閾値を超えたら是正するのが現実的です。
Q 少人数の営業チームでもクレンジングは必要ですか?
必要です。人数が少ないほど1人が抱えるデータ量に対して整える工数を割きにくく、荒れたまま放置されがちだからです。ただし、少人数だからこそ全件を一気に直す必要はなく、実際に使うデータから範囲を絞れば負荷を抑えられます。最低限、統合・削除のルールだけは文書化しておくと、担当者が変わっても運用を引き継げます。
Q クレンジングは社内で行うべきですか、外注したほうがよいですか?
対象データの量と、必要な専門性で判断します。少量で自社の事情を知る担当が直せるものは社内が向き、数万件規模の連絡先更新や企業情報の付与など、量と専門性が要るものは外注が選択肢です。外注する場合は、補完の精度・保有データの鮮度・自社のSFA/CRMと接続できるかを確認します。接続できなければ納品後の取り込みで手戻りが発生します。
Q 過去データが大量にある場合、どこから手を付けるのが効果的ですか?
まず着手前の棚卸しで、重複率・空欄率・最終更新日・出所の4観点から現状を把握します。そのうえで、実際に分析やリストに使うデータに範囲を絞り、直近2年・主要1オブジェクトから始めます。順序は、重複を先に統合してから表記の標準化・値の修正へ進むと、重複分の作業を繰り返さずに済みます。
Q 個人情報保護やコンプライアンス面で注意すべき点はありますか?
退職者の個人情報や取得経緯が不明な名刺データ、利用目的の同意範囲を超えて保持している連絡先には注意が必要です。個人情報は必要な範囲を超えて保持しないことが原則のため、利用の見込みがないものは削除を検討します。削除の判断は「利用目的が残っているか」「保持の根拠があるか」を軸にし、迷う場合は法務・管理部門と基準をすり合わせます。全社的な統制の設計はデータガバナンスを参照してください。







