C++
 Computer >> コンピューター >  >> プログラミング >> C++

C++で二分木の重複する部分木を検出する方法


問題の概要

二分木が与えられたとき、その中に存在する重複する部分木(duplicate subtrees)をすべて見つける問題を考えてみましょう。ここでいう「重複」とは、構造とノードの値が完全に一致する部分木が2つ以上存在することを意味します。各種類の重複部分木について、代表としてどれか1つの根ノードを返せばよいことになっています。

たとえば、次のような二分木があるとします。

C++で二分木の重複する部分木を検出する方法

この木に含まれる重複する部分木は、以下の2つです。

C++で二分木の重複する部分木を検出する方法

  • 値 4 を持つ単一ノードの部分木(2か所に出現)
  • 根が 2 で、子に 4 を持つ部分木(2か所に出現)

解法のアプローチ:部分木のシリアライズ

この問題を効率的に解く鍵となるのは、部分木を一意な文字列に変換する(シリアライズする)ことです。各部分木を文字列として表現できれば、同じ文字列を持つ部分木同士は「重複している」と判定できます。全体の流れは次の通りです。

アルゴリズムの手順

  • 結果を格納する配列 ret と、シリアライズ文字列の出現回数を記録するマップ m を用意します。
  • 再帰関数 solve() を定義します。引数として現在のノードを受け取り、以下のように動作します。
  • ノードが null(または無効)の場合は "-1" を返します。
  • x := ノードの値を文字列化し、"#" を連結します。
  • left := solve(ノードの左の子)、right := solve(ノードの右の子) を再帰的に求めます。
  • x := x + "#" + left + "#" + right と連結し、この部分木固有のキーを作ります。
  • マップ m[x] のカウントを1増やします。
  • m[x] がちょうど 2 になったタイミングで、そのノードを ret に追加します(3回目以降は追加しないため、同じ種類の重複が結果に複数回入ることはありません)。
  • x を呼び出し元へ返します。
  • メイン側から solve(root) を呼び出し、最後に ret を返します。

この方法では後順走査(post-order traversal)を用いており、「左右の子の情報が確定した後に親ノードのキーを組み立てる」ため、各部分木を正しく一意に識別できます。ノード数を N とすると、各ノードで文字列連結が発生するため計算量は O(N²) ですが、ハッシュマップにより重複判定自体は高速に行えます。

C++での実装例

それでは、実際のコードを見て理解を深めましょう。

#include <bits/stdc++.h>
using namespace std;
class TreeNode{
   public:
      int val;
      TreeNode *left, *right;
      TreeNode(int data){
         val = data;
         left = right = NULL;
      }
};
void insert(TreeNode **root, int val){
   queue<TreeNode*> q;
   q.push(*root);
   while(q.size()){
      TreeNode *temp = q.front();
      q.pop();
      if(!temp->left){
         if(val != NULL)
            temp->left = new TreeNode(val);
            else
               temp->left = new TreeNode(0);
               return;
            } else {
               q.push(temp->left);
            }
            if(!temp->right){
               if(val != NULL)
                  temp->right = new TreeNode(val);
               else
                  temp->right = new TreeNode(0);
                  return;
               } else {
                  q.push(temp->right);
               }
            }
         }
         TreeNode *make_tree(vector<int> v){
            TreeNode *root = new TreeNode(v[0]);
            for(int i = 1; i<v.size(); i++){
               insert(&root, v[i]);
            }
            return root;
         }
         void tree_level_trav(TreeNode*root){
            if (root == NULL) return;
            cout << "[";
            queue<TreeNode *> q;
            TreeNode *curr;
            q.push(root);
            q.push(NULL);
            while (q.size() > 1) {
               curr = q.front();
               q.pop();
               if (curr == NULL){
                  q.push(NULL);
              } else {
              if(curr->left)
              q.push(curr->left);
              if(curr->right)
              q.push(curr->right);
             if(curr->val == 0 || curr == NULL){
                        cout << "null" << ", ";
             } else {
                       cout << curr->val << ", ";
            }
        }
   }
   cout << "]"<<endl;
}
class Solution {
public:
  vector <TreeNode*> ret;
   map <string, int> m;
   string solve(TreeNode* node){
      if(!node || node->val == 0){
         return "-1";
      }
      string x = to_string(node->val);
      x += "#";
      string left = solve(node->left);
      string right = solve(node->right);
      x = x + "#" + left + "#" + right;
      m[x]++;
      if(m[x] == 2){
         ret.push_back(node);
      }
      return x;
   }
   vector<TreeNode*> findDuplicateSubtrees(TreeNode* root) {
      ret.clear();
      m.clear();
      solve(root);
      return ret;
   }
};
main(){
   vector<int> v = {1,2,3,4,NULL,2,4,NULL,NULL,NULL,NULL,4};
   Solution ob;
   TreeNode *root = make_tree(v);
   vector<TreeNode*> trees = ob.findDuplicateSubtrees(root);
   for(TreeNode *t : trees){
      tree_level_trav(t);
   }
}

入力

[1,2,3,4,null,2,4,null,null,null,null,4]

出力

[4]
[2, 4]

まとめ

本記事では、二分木から重複する部分木をすべて検出する方法を解説しました。ポイントは、後順走査によって各部分木を文字列にシリアライズし、ハッシュマップで出現回数を管理する点です。カウントがちょうど2になった時点でノードを結果に追加することで、同じ種類の重複を1つだけ返すという要件も満たせます。木の走査とシリアライズを組み合わせるこの手法は、部分木の比較が必要になるさまざまな応用問題にも役立ちます。


  1. C++で二分木内の重複するサブツリーをすべて検出する方法

    問題の概要二分木が与えられたとき、その中に重複するサブツリー(部分木)が存在するかどうかを判定する問題を考えてみましょう。例として、次のような二分木を取り上げます。この木には、サイズ2の同一のサブツリーが2つ存在します。さらに、それぞれのサブツリー内のDに注目すると、BDとBEもまた重複するサブツリーになっています。解決のアプローチ:木のシリアライズとハッシュこの問題は、木のシリアライズ(直列化)とハッシュテーブルを組み合わせることで効率的に解決できます。基本的な考え方は以下のとおりです。各サブツリーを間順走査(inorder traversal)で文字列としてシリアライズする空のノードには開

  2. C++で二分木における単一値の部分木を数える方法

    二分木が与えられたとき、その木に含まれる「単一値の部分木(Single Valued Subtree)」の個数を求めるのが本記事の目的です。単一値の部分木とは、その部分木を構成するすべてのノードが同じ値を持つような部分木のことを指します。問題の例例として、次のような二分木を考えてみましょう。この木には、以下に示す4つの単一値の部分木が存在します。解法のアプローチ:ボトムアップ方式この問題は、ボトムアップ(下から上へ)の再帰的なアプローチで効率的に解くことができます。基本的な考え方は次のとおりです。各ノードを訪問する際、そのノードを根とする部分木が単一値であるかどうかを判定し、単一値であればカウ