
Anthropic、Claude Fable 5.1とClaude Mythos 5.1を発表
Anthropicは、コーディングと知識労働向けの最先端AIモデル「Claude Fable 5.1」と「Claude Mythos 5.1」を発表した。Fable 5.1は一般利用可能で、Mythos 5.1は信頼されたアクセスプログラムを通じてのみ利用でき、両モデルは科学研究能力とコード処理性能の大幅な改善を実現している。
Fable 5.1は一般向けに利用可能であり、キャッシュ読み込み費用が75%削減されたことにより、典型的なワークロードで約25%、高度なエージェント作業では最大45%のコスト削減を実現した。キャッシュ読み込みは$0.25/百万トークンに、入力トークンは$10/百万、出力トークンは$50/百万となっている。一方、Mythos 5.1はサイバーセキュリティと生命科学分野での信頼されたアクセスプログラムのみを通じて利用可能である。
性能ベンチマーク
Fable 5.1は複数のベンチマークで高い性能を示している。Terminal-Bench-Science 0.1では52.6%のスコアを達成し、前世代のFable 5の24.7%から大幅に向上した。Terminal-Bench 4.0エージェント型コーディングでは55.8%、OSWorld 2.0コンピュータ利用(部分的)では77.9%、OSWorld 2.0コンピュータ利用(厳密)では41.7%、Humanity's Last Exam(ツールなし)では60.9%、AutomationBenchでは31.4%、CursorBench 3.2.0では73.4%のスコアを記録した。
Jane Street Capitalの量的研究責任者Craig Fallsは「内部ベンチマークでは、Claude Fable 5.1がFable 5やOpus 5よりも多くのコード問題を解決し、トレーディング直感で最先端の性能を達成しています。前モデルは長時間の処理で読みづらくなりましたが、Fable 5.1は複数ステップの長期タスクでも読みやすさを保ちます」と述べた。
科学研究への応用
Claude Mythos 5.1はタンパク質バインダー設計において顕著な成果を上げた。Adaptyv Bioのタンパク質設計コンペティションに提出された最高設計と比較して、3つのターゲットに対して結合親和性が10倍高いバインダーを設計した。12のターゲット全体での命中率はほぼ50%に達し、これは典型的なタンパク質設計の10〜15%の命中率を大きく上回る。
Fable 5.1はニューラルネットワークを訓練して金星の3分の1の高解像度標高図を作成した。新しい標高図は従来の10〜20km解像度と比べて2〜3km解像度まで詳細を明らかにし、高さの精度は25%向上している。これはNASA Magellan月探査機の30年前のレーダー画像を活用したものである。
パフォーマンス最適化と安全対策
Mythos 5.1は、カスタムGPUカーネルを作成して中間結果をキャッシュすることで、7つのオープンソース深層学習モデルを最大2.5倍高速化した。この最適化により、GPU費用が30〜60%削減される見込みである。
Fable 5.1のサイバーセキュリティ安全対策は、誤検知を60%削減し、ソフトウェア脆弱性の発見に利用可能となった。一方、Mythos 5.1はバイオロジーと医療リクエストに対する安全対策の誤火報を85%削減した。
Enterprise Frontier Safeguardsは秋から段階的に展開予定であり、約100社の顧客がその開発に協力している。Mythos 5.1はAnthropicの責任あるスケーリングポリシーで定義された次のリスク階層には該当せず、Frontier Compliance Frameworkのより低いリスク区分に留まっているとされる。
Fable 5.1はAmazon Web Services、Google Cloud、Microsoft Azureで利用可能である。Mythos 5.1は現在、米国の限定された組織のみが利用可能であり、米国政府とのパートナーシップで生物学能力へのアクセスプログラムが開発された。
規制への対応
Anthropicは2026年7月、EU AI Act透明性コード・オブ・プラクティスに署名し、190の他の署名者と共に参加した。2026年8月2日以降にリリースされたモデルの出力にはウォーターマークが必須となり、ウォーターマーク検出APIは資格のある組織向けに非公開プレビューで展開中である。
筆者の見立て
- AIモデルが科学発見に重要な貢献をもたらすようになることを示唆している(予想)
- リリースされた金星標高図は、NASA VERITASおよびESA EnVision月探査機がどの地質学的特徴を将来の観測対象にするか判断する際に有用となる可能性がある(予想)
- このような最適化は通常、パフォーマンスエンジニアのチームが数週間を要し、学術研究室では実現困難であることが多いと解釈している(解釈)
- より高度な自律性には新しいリスクが伴うと論じている(意見)
- 蒸留技術は安全リスクを示唆している。蒸留された機能がその後、適切な安全対策なしにリリースされる可能性があるためである(示唆)
この記事は元記事の事実のみに基づいて自動生成されました。
出典
Anthropic「Introducing Claude Fable 5.1 and Claude Mythos 5.1」https://www.anthropic.com/claude-fable-and-mythos-5-1