次世代AI「Ornith 1.5」のPodcast
下記のPodcastは、Geminiで作成しました。
はじめに:AIが自分で自分を育てる新時代がやってきた
人工知能(AI)の世界では、これまで「人間がどれだけ大量で質の高い問題集を用意してAIに解かせるか」という点が性能向上の決め手でした。しかし、人間が手作業でデータを作り続ける手法には時間的・人的な限界があり、AIがさらに賢くなるためのボトルネックとなっていました。
そのような常識を大きく覆す革新的なAIモデルが、2026年8月19日に公開された「Ornith 1.5(オーニス 1.5)」です。
Ornith 1.5の最大の特徴は、AI自身が「自分の苦手分野に合わせた学習問題」を自ら作り出し、その解き方や採点基準まで自分で設計して特訓を重ねる「エンドツーエンドの自己改善ループ」を備えている点にあります。人間が付きっきりで教えなくても、AIが一人で自習を繰り返して勝手に賢くなっていく仕組みが確立されたのです。
しかも、Ornith 1.5は完全に無料で商用利用も可能な「オープンウェイト(MITライセンス)」として公開されています。最大のモデルは商用最高峰であるAnthropic社のClaude Opus 4.8に匹敵するプログラミング性能を誇り、最小のモデルは手元のノートパソコンやスマートフォンでも動作します。
この記事では、AIの専門的な数式に詳しくない初心者の方でも直感的に理解できるよう、Ornith 1.5の驚きの仕組みから、実際の性能、手元のPCでの動かし方までを分かりやすく丁寧に解説します。
Ornith 1.5の全体像:オープンモデル界に現れた超新星
Ornith 1.5は、AI研究スタートアップであるDeepReinforce(Ornith Team)によって開発されました。
ゼロからすべてを開発したのではなく、中国Alibabaが開発した高性能モデル「Qwen 3.5」や米Googleの「Gemma 4」を土台(ベースモデル)として活用し、その上に独自の継続事前学習(CPT)や中間学習、そして自己改善アルゴリズムを積み重ねることで圧倒的な知能を獲得しています。
| 基本項目 | 仕様および詳細内容 |
| モデル名称 | Ornith 1.5(Ornith-1.5 / オーニス 1.5) |
| 開発元 | DeepReinforce / Ornith Team(Hugging Face: ornith-ai) |
| 公開日 | 2026年8月19日 |
| ライセンス形態 | MITライセンス(研究・商用利用ともに完全無料・無制限) |
| ベースモデル | Qwen 3.5、Gemma 4 |
| 標準コンテキスト長 | 262,144トークン(YaRN factor 4.0適用で約100万トークンまで拡張可能) |
| 対応モダリティ | テキスト + 画像(マルチモーダル視覚理解に対応) |
| 出力の特徴 | <think> タグによる思考プロセスの可視化、ツール呼び出し(Function Calling)対応 |
| 提供フォーマット | bf16、GGUF(llama.cpp/Ollama)、MLX(Mac向け)、FP8、NVFP4 |
Ornith 1.5は、一般的なチャットボットのように単におしゃべりをするだけでなく、自律的にツールを操作して複数ステップの複雑な課題をやり遂げる「AIエージェント」としての能力を極限まで高めています。
標準で約26万トークン(文庫本数十冊分に相当)という非常に長い文章やコードを一度に読み込むことができ、技術文書の全体把握や大規模なソースコードの修正も余裕を持ってこなすことができます。
AIが自分で机に向かって自習し成長する様子を描いた概念図


なぜ勝手に強くなるのか?「自己改善ループ」と数学的メカニズム
Ornith 1.5が世界中で注目されている最大の理由は、モデル自身が自走して成長し続ける「自己改善ループ(Self-Improvement Loop)」の構造にあります。
前世代の「Ornith 1.0」では、問題を解くための道具や処理手順を自分で用意する「Self-Scaffolding(自己足場作り)」という技術が導入されていました。Ornith 1.5ではこの仕組みをさらに進化させ、「学習すべき問題そのものを作る」段階から「足場作り」、そして「解答の実行」までの全工程をひとつの輪として統合しました。
3つのステージが連動する学習サイクル
Ornith 1.5のトレーニングは、以下の3つのステージが途切れることなく連動して行われます。
- タスク提案ステージ(Task Proposer Stage): モデル自身が過去の学習履歴や対象となるコードベースを振り返り、「今の自分が解けるか解けないかのギリギリの難易度を持つ新しい問題」を自動生成します。
- スキャフォールド生成ステージ(Scaffold Generator Stage): 生成された問題に対して、それを解くために必要な指示文、使用する補助ツール、問題の分解手順、そして客観的に正誤を判定するための評価環境(ハーネス)を自ら設計します。
- ポリシーロールアウトステージ(Policy Rollout Stage): 構築した足場を利用しながら、実際に課題の解決策(ロールアウト)を複数パターン生成し、テストを実行します。
ここで得られた成否の結果は、3つのステージすべてにフィードバックされ、「GRPO(Group Relative Policy Optimization)」という強化学習アルゴリズムによって同時にパラメータが更新されます。
その結果、「モデルが賢くなる → よりハイレベルな練習問題を作れるようになる → 解法の足場が頑丈になる → さらに高い学習成果が得られる」という好循環が生まれ、人間の介入なしに知能が螺旋状に向上していくのです。
ズルや手抜きを防ぐ厳密な報酬設計
AIに自由に問題を作らせると、「誰でも即答できる超簡単な問題」ばかり作って高得点を稼ごうとしたり、「正解が存在しないデタラメな問題」を作って採点システムを壊してしまう危険性(報酬ハック)が生じます。Ornith 1.5の開発チームは、この問題を数学的な報酬関数によってエレガントに解決しました。
タスク生成に対する報酬 $R_{\text{task}}$ は、以下の掛け算によって厳格に計算されます。
それぞれの要素の意味は次の通りです。
- 妥当性ゲート $V(q,s)$: 生成された問題 $q$ と評価環境 $s$ が、正しい解答のみを合格とし、間違った解答を確実に不合格にできるかを厳密に判定します。もし問題の前提が破綻していたり採点が不可能な場合は値が $0$ になり、掛け算全体としてタスク報酬が即座にゼロになります。
- フロンティア難易度関数 $D$: AIがその問題に複数回挑んだときの成功率 $p$ を計測し、目標とするフロンティア成功率 $p^* = 0.2$(正答率20%前後)のときに報酬が最大化されるよう設計されています。
正答率が100%に近い簡単すぎる問題や、正答率が0%の解けない問題は報酬が極端に低くなるため、AIは「今の実力よりほんの少しだけ難しい良問」を必死に探して作成するよう誘導されます。
- 新規性・多様性スコア $N(q)$: 過去に出題した問題の蓄積バッファ $\mathcal{B}$ との最大類似度を計算し、似たような問題の焼き直しを排除します。
これらに加えて、評価環境の頑健性を評価するハーネス報酬 $R_{\text{harness}} = C(q,h) \times F(h,\{\tau_i\}) \times H(h)$(問題適合度 $C$、評価忠実度 $F$、ハック耐性 $H$)と、実際の解答の正しさを測るロールアウト報酬 $R_{\text{rollout}}(\tau_i) = h(q,\tau_i)$ が組み合わさることで、一切の隙がない自己改善環境が完成しています。
3つのステージが連動する「自己改善ループ」の構造解説図


あなたの環境にぴったりの1台は?3つのモデルサイズと選び方
Ornith 1.5は、用途や所有しているパソコンのスペックに応じて選べるように、3つのモデルサイズが展開されています。前世代に存在した31B Denseモデルは整理され、より効率的なアーキテクチャへと刷新されました。
| モデル名 | 内部構造 | 総パラメータ数 | 実行時アクティブ | 4bit量子化サイズ | 必要ハードウェアの目安 |
| Ornith-1.5-397B | MoE | 397B | 約17B(推定) | 約242GB | 80GB級GPU×8基(H100/H200等) |
| Ornith-1.5-35B-A3B | MoE | 35B | 3B[cite: 4, 5, 7, 8, 10] | 約21.7GB[cite: 3, 4] | VRAM 24GB級GPU(RTX 4090)やMac |
| Ornith-1.5-9B | Dense | 9B | 9B | 約5.63GB[cite: 3, 4, 9] | 一般的なノートPC、iPhone/Android |
Ornith-1.5-397B(フラグシップモデル)
シリーズ最高峰の頭脳を持つ巨大モデルです。複数の専門家ネットワークから最適な部分だけを選んで動かす「MoE(Mixture of Experts)」構造を採用しており、超高難度のプログラミングや複雑な論理推論で世界トップクラスの成績を叩き出します。ただし、非圧縮(bf16)で約800GBのVRAMを消費するため、データセンターやクラウドGPUサーバーを保有する企業・研究機関向けとなります。
Ornith-1.5-35B-A3B(実務での大本命・エンジニア推奨)
個人開発者や一般的な開発現場において、最もコストパフォーマンスと性能のバランスが優れているのがこの35Bモデルです。
「A3B(Active 3B)」という名前が示す通り、350億個のパラメータを持ちながら、1トークンを処理する際に動かすパラメータはわずか「30億個(3B)」に絞り込まれています。4ビット量子化(Q4_K_M)を施せば約21.7GBのファイルサイズに収まり、RTX 3090やRTX 4090といった一般的な24GBのVRAMを搭載したグラフィックボード1枚、あるいは32GB以上のメモリを積んだApple Silicon Macで軽快に動作します。
Ornith-1.5-9B(超軽量・モバイル&入門用)
「まずは手元の普通のパソコンで試してみたい」という初心者に最適なコンパクトモデルです。4ビット量子化版なら約5.63GBと極めて軽量で、8GB〜16GB程度のメモリを持つノートパソコンで快適に動作します。
さらに、iOSやAndroidスマートフォンで動作するように特化された「Ornith-1.5-9B-Mobile」も提供されており、スマホ単体で完全オフラインの高度な推論を実行することが可能です。
3つのモデルサイズと対応デバイスのポジショニングマップ


ベンチマークで見る驚異の性能と「下剋上」の実態
Ornith 1.5が公開直後からコミュニティで大きな話題となった理由は、各種ベンチマークテストにおいて、格上の超巨大モデルや商用プロプライエタリモデルを凌駕するスコアを叩き出したためです。
以下の表は、公式技術レポートにおいて発表された主要ベンチマークの結果です(すべて5回のテストの平均値)。
| ベンチマーク指標 | テスト内容 | Ornith-1.5 (397B) | Claude Opus 4.8 | Ornith-1.5 (35B-A3B) | Ornith-1.5 (9B) |
| Terminal-Bench 2.1 (Terminus-2) | ターミナル操作と自動化 | 86.1[cite: 3, 4, 7, 8, 10] | 85.0 | 67.8 | 46.2 |
| Terminal-Bench 2.1 (Claude Code) | CLIエージェント開発環境 | 85.2 | — | 68.5 | 47.0 |
| SWE-bench Verified | 実際のGitHubバグ修正 | 86.0 | — | 79.0 | 70.6 |
| SWE-bench Pro | 高難度ソフトウェア開発課題 | 65.1 | — | 59.6 | 47.5 |
| DeepSWE | 深層ソフトウェア工学推論 | 56.0 | 59.0 | 22.0 | — |
| GPQA Diamond | 博士課程レベルの科学・論理推論 | 92.8 | — | 89.2 | 86.4 |
| ClawEval | 実ユーザー環境での自律エージェント | 81.4 | — | 72.5 | 66.5 |
| MCP-Atlas | 外部ツール・API連携能力 | 80.0 | — | 70.2 | 54.2 |
| BrowseComp | 複雑なWebブラウジング調査 | 86.6 | — | 67.6 | 56.4 |
軽量モデルが格上を打ち破る「下剋上」
ベンチマーク結果の中でも特に注目すべきは、小型モデルが自分よりも何倍も巨大な他社モデルを上回る「下剋上」が起きている点です。
- 9Bモデルの躍進: 最も小さいOrnith-1.5-9Bは、難関ベンチマーク「SWE-bench Pro」で47.5というスコアを記録しました。これはベースとなったQwen 3.5-9B(31.3)の約1.5倍に達し、さらにパラメータ数が3倍以上もある「Gemma 4-31B(35.7)」を大きく突き放しています。また、超難問推論の「GPQA Diamond」でも86.4をマークしており、単なる暗記ではなく深いステップ・バイ・ステップの思考力(Reasoning)を備えていることが実証されています。
- 35Bモデルの驚異的効率: Ornith-1.5-35B-A3Bは、推論時にわずか3B分のリソースしか消費しないにもかかわらず、コーディング領域において総パラメータ397BのQwen 3.5-397Bを上回る効率性を発揮しています。
自己改善ループによって鍛えられたモデルは、ただパラメータの数が多いだけのモデルよりも無駄がなく、洗練された思考手順を踏むことができるため、サイズからは想像もつかない高い知能を発揮できるのです。
自宅のPCで今すぐ動かす!初心者向けステップバイステップ導入手順
Ornith 1.5はモデルファイル(重み)がHugging Face上で完全に無料公開されているため、誰でも手元のパソコンにダウンロードして動かすことができます。
現時点ではChatGPTのような公式のWebチャットサイトは用意されていないため、パソコン上でローカルLLMを動かすためのアプリを使って動かすのが基本となります。
方法1: 初心者に一番おすすめ!LM Studioを使う手順(所要時間15分)
マウス操作だけで完結するため、プログラミング経験がない方に最もおすすめの方法です。
- ソフトのインストール: 公式サイトから「LM Studio」をダウンロードしてインストールします。Windows、Mac(Apple Silicon)、Linuxのすべてに対応しています。
- モデルの検索: LM Studioを起動し、上部の検索虫眼鏡アイコンをクリックして「
ornith-1.5」と検索します。 - 適切なサイズのダウンロード:
- メモリが8GB〜16GBのPC:
Ornith-1.5-9Bの「Q4_K_M」を選択。 - メモリが32GB以上のMacやRTX 4090搭載PC:
Ornith-1.5-35B-A3Bの「Q4_K_M」またはMLX版を選択。 - 「Download」ボタンを押すと自動的に約5.6GB〜21.7GBのファイルがダウンロードされます。
- メモリが8GB〜16GBのPC:
- チャットの開始: 左側の吹き出しアイコン(Chat)を開き、上部のドロップダウンからダウンロードしたOrnith 1.5を選択してロードします。これで、完全オフラインで安全にAIとの会話やプログラミング相談が可能になります。
方法2: エンジニアにおすすめ!Ollamaを使う手順(コマンド1行)
すでにターミナル操作に慣れている方であれば、Ollamaを使うことで瞬時に起動できます。
ターミナルを開き、以下のコマンドを1行入力してEnterキーを押すだけです。
ollama run ornith-1.5:9b
モデルの自動ダウンロードが始まり、完了するとそのままターミナル上で対話がスタートします。
より高度なサーバー運用やAPI連携を行う場合は、高速推論エンジンの「vLLM(バージョン0.19.1以上)」や「SGLang(0.5.9以上)」を使用することで、reasoningパーサーやtool-call機能をフル活用した自律エージェント環境を構築できます。
自宅のPCでOrnith 1.5を安全・手軽にセットアップする導入ガイド図


導入前に必ず知っておきたい注意点・限界とファクトチェック
Ornith 1.5は非常に魅力的なモデルですが、実際に仕事やプロジェクトに導入する前には、いくつかの現実的な注意点と制約を理解しておく必要があります。
ベンチマークスコアは「開発元の自己申告値」であること
公開されている輝かしいベンチマークスコアは、現段階では開発チーム自身が測定・公表した数値であり、第三者の独立機関による大規模な追試・査読はまだ完全には揃っていません。
一部のコミュニティ検証では、複雑なクラウドサーバーの自動構築タスクを9Bモデルに実行させた際に途中で停止してしまったり、プロンプトの記述方法によって出力品質が大きく左右される事例も報告されています。数字を盲信するのではなく、「自分のやりたいタスクで実際に動くか」をご自身の手元で小さく試してみることが重要です。
全ての分野で商用APIに勝っているわけではないこと
公式発表の17種類のベンチマーク指標を詳細に分析すると、最上位の397BモデルであってもClaude Opus 4.8に対して「7勝10敗」という勝敗バランスになっています。
ターミナル操作やコードのリポジトリ修正といった得意分野では Claude を上回る場面があるものの、極めて難度の高い長期推論タスク(Frontier-Benchなど)や広範な一般知識を問うタスクでは、依然として商用トップモデルに軍配が上がります。
「モデルは無料」でも「動かすコスト」は発生すること
Ornith 1.5はMITライセンスのためソフトウェア代金は完全にゼロ円ですが、モデルを動かすためのGPUハードウェア費用や電気代はユーザー側の負担となります。特に397Bモデルを自社で常時稼働させる場合、8枚の高性能エンタープライズGPU(H200など)が必要となり、インフラ構築費用は決して小さくありません。
このモデルが向いている人・向いていない人
- Ornith 1.5が最適な人:
- 会社の機密コードやプライベートなデータを外部のクラウドAPIに絶対に送信したくない人(完全ローカル環境で安全に動作)。
- 月額のAPI利用料やトークン課金を気にせず、ローカル環境で自律型のコーディングエージェントを回したいエンジニア。
- AIが「なぜその結論に至ったのか」の思考過程(
<think>タグ)を細かく分析・デバッグしたい開発者。
- 向いていない人:
- ソフトウェアのインストールや設定を行わず、ブラウザを開くだけで使える完成されたチャットサービスのみを求める非エンジニア。
- あらゆるジャンルの雑学や百科事典的な知識の網羅性を最優先したいユーザー。
まとめと今後の展望:自律型AIが切り拓く未来
Ornith 1.5は、「人間が手作業でデータを集めてAIを育てる」という従来の開発パラダイムから、「AIが自ら課題を発見し、足場を組み、自習して進化する」という自律的な新しい学習パラダイムへの転換を象徴する歴史的なモデルです。
オープンソースでありながら、ターミナル操作やソフトウェア開発といった実戦的タスクで商用最高峰モデルに迫る実力を発揮し、さらにノートパソコンやスマートフォンで動かせる軽量版まで揃っている点は、世界中の開発者にとって大きな恩恵をもたらします。
ローカルLLMの世界は急速に進化しています。まずは手元のPCで軽量な9Bモデルや35Bモデルを導入し、AIが自ら思考を巡らせながら問題を解決していく次世代の知能を、ぜひご自身の手で体験してみてください。
参考資料
- Ornith-1.5とは何か, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- 自己改善AIモデル「Ornith-1.5」公開, https://gigazine.net/news/20260820-ornith-1-5/
- Ornith-1.5 の紹介, https://zenn.dev/kun432/scraps/2d04d533e978c1
- 「Ornith-1.5」の概要まとめ, https://note.com/npaka/n/n654b6af6387b
- 概要:Ornith-1.5-9Bとは何か, https://note.com/humble_bobcat51/n/n999caede464b
- Ornith-1.5の衝撃と検証, https://www.youtube.com/watch?v=XaRBBPoNreQ
- Ornith-1.5完全解説と技術仕様, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- Ornith-1.5-9Bの実践的評価, https://note.com/humble_bobcat51/n/n999caede464b
- Ollama Ornith-1.5 Library, https://ollama.com/library/ornith-1.5
- Ornith-1.5 モバイル動作とオープンソース展開, https://gigazine.net/news/20260820-ornith-1-5/
- Ornith-1.5-397B と DraftModel の検証, https://zenn.dev/munakatakm/articles/c93d3d0b22a4e0
- Ornith-1.5: From Self-Scaffolding to Self-Improvement, https://ornith.ai/ornith_1_5.html
- Ornith-1.5 アーキテクチャとライセンス, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- 生成AIウィークリー Ornith特集, https://www.techno-edge.net/article/2026/07/10/5280.html
- Qwen3.5ベースの独自学習モデルOrnith, https://zenn.dev/munakatakm/articles/c93d3d0b22a4e0
- 自己改善型トレーニングモデルOrnithの素性, https://note.com/zephel01/n/nb64f1495778b
- Ornith-1.5 Hugging Faceコレクション公開, https://gigazine.net/news/20260820-ornith-1-5/
- AIエージェント向け性能とOrnith-1.5, https://note.com/npaka/n/n654b6af6387b
- 自己改善とタスク生成の仕組み, https://note.com/npaka/n/n654b6af6387b
- Run Ornith Locally with Ollama Guide, https://www.youtube.com/watch?v=U-I2lMWWfXE
- AI研究スタートアップDeepReinforceの動向, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- 自律デバッグエージェントとしてのOrnith, https://note.com/humble_bobcat51/n/n999caede464b
- Ornith-1.5の独立検証とベンチマーク考察, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- 3行でわかるOrnith-1.5の全体像, https://note.com/ai_driven/n/n2ec0d9b05f8b
- Ornith-1.5の実用性とインフラ要件, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- Ornith-1.5 3モデルの詳細比較, https://note.com/npaka/n/n654b6af6387b
- Ornith-1.5 Base Models and CPT, https://ornith.ai/ornith_1_5.html
- MacとMLX版Ornith-1.5の動作検証, https://qiita.com/youtoy/items/cdac38faf69e48a1a809
- Ornith-1.5 Technical Details and Evaluation, https://ornith.ai/ornith_1_5.html
- Ornith-1.5 オープンソースLLMの新地平, https://zenn.dev/kun432/scraps/2d04d533e978c1
- 自己改善ループのメカニズムと量子化, https://zenn.dev/kun432/scraps/2d04d533e978c1
- Ornith-1.5 NVFP4モデルの発表, https://zenn.dev/munakatakm/articles/c93d3d0b22a4e0
- Ornith-1.5 利用コストとAPIの有無, https://ai-revolution.co.jp/media/what-is-ornith-1-5/
- 3段階の同時最適化プロセス, https://note.com/ai_driven/n/n2ec0d9b05f8b
- ローカルLLMとしてのOrnith-1.5実践導入, https://note.com/genelab_999/n/neb14eada6936



コメント