Xiora Ocean LLM の 独自 dataset — Xiora unique な 4 種 data moat の 構造
Ocean LLM の moat は 短期複製が 難しい 業種特化 4 種 dataset。 Xiora 自社プロダクト 実運用の 蓄積プロセス を 情報整理。
Introduction
汎用 LLM (ChatGPT / Claude / Gemini) と 独自 LLM を 差別化 する 最大の要因 は「学習 dataset の 独自性」です。
Xiora が 開発する Ocean LLM は、業種特化 4 種 dataset を moat として 構築します。 本記事では 4 種 dataset の 由来と、短期 複製が 困難な 理由 を 情報として 整理します。
Dataset 1 — Kigen App 由来 (医薬品期限 印字読取)
Kigen App は 市販薬 / 処方薬 / サプリメント の 使用期限を 印字画像 から 読取・管理する SaaS。 過去 6 ヶ月で 900+ 件の 医薬品を 登録済み。
この dataset は 「市販薬パッケージ 画像 (印字位置 + 光条件 + フォント)」 + 「使用期限 の 実 label データ」 の pair で 構成される。
汎用 OCR は 医薬品パッケージ の 印字 (小さい・端に配置・銀色反射) の 精度が 頭打ち。 Ocean は 該 領域 の fine-tuning で 汎用 OCR を 上回る 精度を 想定。
moat 性: 900+ 件 の 実物 画像 dataset を 短期 複製 する には、同規模の SaaS 事業を 6 ヶ月 継続運用する 必要 = 実質 複製困難。
Dataset 2 — Gourmie AI Reply 由来 (飲食口コミ ローカル対応)
Gourmie は 飲食店 の Google / 食べログ 口コミ に対する 返信 draft を 生成する SaaS。 越谷 3 店舗で 3 ヶ月 テスト運用済み。
この dataset は 「口コミ本文 (関東圏 中小店舗、方言含む)」 + 「店長が 実採用した 返信 テキスト」 の pair で 構成。
汎用 LLM は 「地域方言 + 業種特有 の トーン (焼肉店 / カフェ / 高級店)」 の 差 を 表現し切れない。 Ocean は 該 領域 の fine-tuning で ローカル特化。
moat 性: 実店舗 の 返信データ (店長承認 済み) は 3 ヶ月-6 ヶ月 の 実運用 が 必要で、短期 生成 困難。
Dataset 3 — XAI Legal Chain 由来 (SES / 準委任 契約書 パターン)
XAI Legal Chain は 中小 IT サービス 会社 の SES / 準委任 / 派遣 契約書 を 事前 review する サービス (Track Z)。
この dataset は 「実 契約書 のパターン」 + 「弁護士 スポット review 経由 の 判定結果 (準委任 / 派遣 区別 / SLA 妥当性 等)」 の pair。
汎用 LLM は SES 契約 の 準委任 / 派遣 区別 判定を 誤ることが 多い (特に 派遣元 責任 の 条項)。 Ocean は 該 領域 の fine-tuning で 判定精度 up。
moat 性: 弁護士 review 経由 の 判定 data は 弁護士 コスト が 掛かるため 短期 複製困難、Xiora は 内部 スポット review 契約で 継続蓄積。
Dataset 4 — XCloud Connect 由来 (情シス代行 現場ログ)
XCloud Connect は 中小企業 の 情シス代行 (社内 IT ヘルプデスク) を SaaS 化 した サービス。 対応ログ が 継続蓄積。
この dataset は 「社内 従業員 の 質問チャット」 + 「情シス 代行者 の 実解決手順 (SaaS 設定変更 / パスワード リセット / VPN トラブル 等)」 の pair。
汎用 LLM は 「特定 SaaS の UI 挙動 + 実際の管理コンソール 手順」 の 詳細が 追えず、抽象論に 落ちる 傾向。 Ocean は 実手順 fine-tuning で 現場対応 up。
moat 性: 実 情シス 代行 の 蓄積は 数ヶ月-数年 の 継続運用 が 前提、短期 複製 は 困難。
4 種 dataset の 統合方針
上記 4 種 dataset は 個別 の SaaS 運用 で 蓄積される、いわば 「副産物」。 Xiora は 全 dataset の legal review (個人情報 匿名化・利用同意) を 経て Ocean 学習コーパス に 組み込む予定。
各 dataset は 独立 タスク (OCR / 口コミ / 契約書 / 情シス) だが、共通で 「日本 中小企業 × 業務現場」 という axis を 共有 = 汎用 LLM が 弱い 領域を 束ねる。
Roadmap (再掲)
Ocean LLM は Xiora の 3-year vision の 中核。 P0-P5 の 5 phase (P0 = 準備 / P1 = dataset 収集 / P2-P3 = fine-tuning / P4 = β評価 / P5 = 商用 API) で 段階的に 構築。
詳細は https://xiora-official.com/insights/xiora-ocean-llm-p0-p5-roadmap.html を 参照。
Disclaimer
本記事の 4 種 dataset は Xiora 自社の 実運用 蓄積 に 依拠します。 dataset 数値 (件数・カバー率) は 現時点の snapshot、継続運用 で 更新される 予定です。
Ocean LLM の 商用提供時期・料金 は 変動 する 可能性 があります。 利用は 各サービス の 利用規約・AI 免責事項 (https://xiora-official.com/legal/) に 従います。
関連 Xiora プロダクト
本記事のトピックに直接関わる Xiora 自社プロダクトです。
← Insights 一覧へ