AI / DATA / ANALYSIS
蓄積した募集データから賃料を査定するモデル
賃料査定モデル — 相場の中心と幅
CHALLENGE
課題
「この条件の部屋は、いくらで貸せるか」。既存の査定サービスは1件ずつ照会する道具で、一括処理や自社の判断への組み込みには使えない。一方で「AIが賃料を算出します」と名乗るモデルは、実際には当たらない個別の1戸の額を保証したように見えてしまう。どこまで信じてよいかを正直に定義した、自前の査定モデルが必要だった。
APPROACH
取り組み
- 定点観測で蓄積した募集データ(約1.2万件・約3,000棟)を使い、面積・築年・階・構造・駅徒歩・駅・募集時期の効果を掛け算で積み上げる対数線形回帰(ヘドニック法)
- 当てはめ過ぎの検証は建物単位のホールドアウトで行う(同じ建物の部屋を学習と検証に分けない)
- 同じ建物の部屋は誤差が相関する。クラスタ頑健な標準誤差を使い、行数でなく独立な建物数で精度を測る
- 予測区間と信頼区間を分ける。「この1戸の額」は幅で、「この条件の相場の中心」は狭い幅で答える。称した区間に実際に何%入るか(キャリブレーション)を品質指標にした
- 時間の交絡を統制する。築年は募集時点で計算し、募集時期と市場トレンドを説明変数に入れる
- 季節性は賃料ではなく「決まる速さ」に出ると実測したため、賃料モデルに月は入れない。速さは予測でなく目安として別枠で示す
TECH
技術
- Python 3 / NumPy(回帰・分位・検証は自前実装)
- 入力は定点観測の gzip JSONL / JSON(通信なし・再パースなし)
- 実現可能性・キャリブレーション・中央値精度の検証をスクリプトで残し、再現できる形にした
- 出力は係数一式と predict 関数。物件レポート生成スクリプトから読み込んで使う
NOW
現在地
「この条件の相場の中心はどこか」は狭い幅で、「この1戸がいくらで決まるか」は区間で答えられるモデルになった。称した区間に実際に入る割合を建物単位のホールドアウトで確認している。先方の実績データとの突合にも使い、想定家賃が市場相場のどの位置にあるかを第三者データで示せた。現在は、実際の成約賃料を正解にした外部査定サービスとの精度比較と、業務判断への組み込みを検証中。
SCALE
規模
- 学習データ: 約1.2万件・約3,000棟(十数年分の募集履歴)
- 建物単位ホールドアウト、50/80/90%区間のキャリブレーション検証
OTHER