総パラメータ770B・コンテキスト100万トークン。無料枠でも利用できます
FlashLabs株式会社(本社:東京都千代田区、代表取締役:細井洋一、以下「FlashLabs」)は、米国のAI研究機関Continuum AIが開発し、当社が日本市場向けに独占提供するAI推論ゲートウェイ「OrcaRouter」において、Tencentが開発した最新のフラッグシップモデル「Hy4 preview」の提供を開始したことをお知らせします(2026年9月29日時点で提供中)※1。

「Hy4 preview」は、総パラメータ770Bのうち、1トークンあたり49Bを活性化するMoE構成(多数の専門家を用意し、必要なものだけを使う方式)のモデルです。コンテキスト長は約100万トークン、出力の上限は6万4000トークン。コーディングエージェント、複雑なツール操作、業務の生産性向上を想定したテキスト専用のモデルで、推論の深さは3段階から選べます※2。
あわせてOrcaRouterでは、「Hy4 preview」を無料で利用できる枠への追加も行いました。クレジットを購入せずに、フラッグシップ級のモデルを試せる環境を提供します※1※2。
主なポイント
- 総パラメータ770B、1トークンあたり49Bを活性化するMoE構成(78層・ルーティング専門家256+共有専門家1)※2
- コンテキスト長は約100万トークン、出力の上限は6万4000トークン※2
- 推論の深さは3段階(high・low・none)から選択でき、既定はhigh※2
- ネイティブのツール呼び出しと構造化出力に対応。コーディングエージェントや複雑なツール操作を想定※2
- 投機的デコーディング用のMTP層を内蔵し、生成の高速化に対応※2
- 無料枠でも利用可能(「Hy4 preview (Free)」として提供)※1
- 有料枠の料金は、入力100万トークンあたり0.834米ドル、出力2.501米ドル、キャッシュ読み出し0.042米ドル(2026年9月29日時点・税別)※2
- テキスト専用のモデルです(画像入力には対応しません)※2
開発の背景
エージェント型のAIアプリケーションでは、1つの処理の中で、コード生成、調査、データ分析、要約といった性格の異なる作業が連続します。すべてを1つのモデルでこなすより、規模が大きく推論に強いモデルと、軽くて速いモデルを組み合わせる方が、コストと品質のバランスを取りやすくなります※2。
一方で、性能の高いモデルほど、契約や料金体系がベンダーごとに異なります。複数のモデルを比較検討するには、それぞれのアカウントとAPI仕様に向き合う必要がありました。OrcaRouterは、こうしたモデルをOpenAI互換のAPIから同じ形式で利用できるようにすることを目的としています。
「Hy4 preview」は、その中でも規模の大きいモデルです。総パラメータ770Bのうち1トークンあたり49Bを活性化するMoE構成により、大きなモデルでありながら、推論時に使う計算量を抑える設計になっています※2。
「Hy4 preview」の仕様
- 構成:MoE(総パラメータ770B・1トークンあたり49Bを活性化・78層・ルーティング専門家256+共有専門家1)※2
- コンテキスト長:約100万トークン※2
- 出力の上限:6万4000トークン※2
- 入力:テキストのみ(画像入力には対応しません)※2
- 推論の深さ:3段階(high・low・none)から選択。既定はhigh※2
- 対応機能:ネイティブのツール呼び出し、構造化出力、投機的デコーディング用のMTP層※2
- 想定用途:ソフトウェアエンジニアリング、オフィス業務とデータ分析、ゲームの試作、科学研究※2
推論の深さは、数学やコーディングのように思考の段取りが必要な用途ではhighを、応答速度を優先したい場面ではlowまたはnoneを選ぶ、といった使い分けができます※2。
Tencentによる評価と、プレビュー版の位置づけ
Tencentは、163名の専門家と203のエンジニアリング課題による社内のブラインド評価を実施し、「Hy4 preview」が平均2.99点、比較対象のGLM 5.3が2.92点、Kimi K3が2.94点だったとしています※2。これは開発元による社内評価であり、当社が同一条件で再計測したものではありません※2。
またTencentは、プレビュー版であることによる粗さも示しています。必要以上に推論に時間をかける場合があること、自分の作業を過剰に検証する傾向があることを既知の課題として挙げています※2。
提供形式と料金
- 無料枠:「Hy4 preview (Free)」として提供※1
- 有料枠:入力100万トークンあたり0.834米ドル、出力100万トークンあたり2.501米ドル、キャッシュ読み出し100万トークンあたり0.042米ドル(2026年9月29日時点・税別)※2
- 対応API:チャット補完(/v1/chat/completions)とResponses API(/v1/responses)※2
- モデルページ:https://www.orcarouter.ai/ja/models/tencent/hy4-preview/無料枠:https://www.orcarouter.ai/ja/models/tencent/hy4-preview-free※1
今後の展望
FlashLabsは、AIエージェントの内側で使うモデルを選ぶ際に、性能とコストの両面から比較できる環境づくりを進めてまいります。OrcaRouterでは、新しく公開されたモデルをいち早く試せるよう、無料枠の拡充と提供モデルの追加を継続します。
OrcaRouterについて
OrcaRouterは、米国のAI研究機関Continuum AIが開発し、FlashLabs株式会社が日本市場向けに独占提供するAI推論ゲートウェイ(AIモデルへのアクセスを1つにまとめる中継サービス)です。OpenAI互換のAPIを備え、Anthropic、OpenAI、Google Gemini、DeepSeek、Grok、Qwenなど200以上のLLM・生成AIモデルを単一のゲートウェイから利用できます。OrcaRouterのAIモデル一覧からすべてのモデルを確認できます。
会社概要
FlashLabs株式会社
- 本社所在地:東京都千代田区一番町10番8号
- 代表取締役:細井洋一
- 設立:2023年7月
- 事業内容:AI応用研究所(Human-AI Hybridで営業・CXの自動化・自律化。OSS音声モデルChromaの開発元)
- URL:https://www.flashlabs.ai/
Continuum AI
- 「次の10年の知能システムを支える基盤インフラを開発する研究機関(米国)」
- OrcaRouterの開発・提供
- URL:https://www.continuum01.ai/
本件に関するお問い合わせ
FlashLabs株式会社 マーケティング部 小林光喜
E-mail:koki.kobayashi@myflashcloud.com
※1 「Hy4 preview」の提供開始・無料枠での提供に関する記述は、OrcaRouterのモデルページ(日本語版・2026年9月29日時点)およびOrcaRouter公式Xアカウント(@OrcaRouter)での発表(2026年9月29日)に基づきます。
※2 仕様・料金・評価・既知の課題に関する記述は、OrcaRouterのモデルページに掲載された開発元(Tencent)の情報(2026年9月29日時点)に基づきます。「Hy4 preview」はTencentが提供するモデルであり、OrcaRouterは同モデルを、他のモデルと同様に単一のAPIから利用できる形で提供します。料金は為替や改定により変動することがあります。開発元による社内評価のスコアは当社が同一条件で再計測したものではありません。
※3 本リリースに掲載しているURLは、2026年9月29日時点で当社が確認したものです。