本文へスキップ
株式会社オブライト
サービス
私たちについて
会社概要
コラム
用語集
料金
無料ツール
お問い合わせ
English
English
メニューを開く
コラム
SWE-Bench
「SWE-Bench」のコラム
3件の記事
AI
2026-07-26
Claude Opus 5 徹底解説 — 2026年7月24日 Anthropic 公開、価格据え置き $5/$25 で Frontier-Bench 18.7%→44.4% 1M コンテキスト・128K 出力(Batch 300K)、新努力レベル `xhigh`、OSWorld 2.0 70.57% / SWE-bench Verified 96.0% Opus 4.8 は legacy 化・Opus 4.1 は2026年8月5日廃止 — `thinking: disabled` × `xhigh` は 400 エラーの破壊的変更あり
**Anthropic が2026年7月24日に Claude Opus 5 を公開**。**価格は $5 / $25 per M tokens で Opus 4.8 から据え置き**のまま、**Frontier-Bench v0.1 は 18.7% → 44.4%(xhigh)**、**OSWorld 2.0 は 55.7% → 70.57%**、**ARC-AGI-3 は 1.52% → 30.16%** と伸びました。**1M コンテキスト(default = maximum)/出力上限 128K(Batches API で 300K)**、プロンプトキャッシュ最小は 512 トークンに引き下げ。**新しい努力レベル `xhigh`**(high の上・max の下)は30分以上走る長時間エージェント向けで、Frontier-Bench では max(43.3%)を上回ります。**破壊的変更**として `xhigh` / `max` では thinking を無効化できず(400 エラー)、**Opus 4.8 は legacy 化・Opus 4.1 は2026年8月5日廃止**。SWE-bench Verified 96.0%、ただし SWE-bench Pro は 79.2% で Fable 5(80.0%)にわずかに届かず、Opus 5 が置き換えるのは Fable 5 ではなく Opus 4.8 です。
Claude Opus 5
Anthropic
LLM
AI
2026-07-01
Claude Sonnet 5 徹底解説 — 2026年6月30日 Anthropic 公開、SWE-bench Verified 92.4% で Opus 4.6 超え(+12pt) 1M コンテキスト・OSWorld-Verified 88.3% で人間専門家 72.4% を上回り、GPQA Diamond 96.2% / ARC-AGI-2 84.7% Introductory $2/$10 per M tok(〜2026-08-31)→ Standard $3/$15、Claude Free / Pro / Claude Code Pro のデフォルトモデルに
**Anthropic が2026年6月30日に Claude Sonnet 5 を公開** しました([公式リリース](https://www.anthropic.com/news/claude-sonnet-5) / [System Card](https://www.anthropic.com/claude-sonnet-5-system-card) / [TechCrunch 報道](https://techcrunch.com/2026/06/30/anthropic-launches-claude-sonnet-5-as-a-cheaper-way-to-run-agents/) / [VentureBeat](https://venturebeat.com/technology/anthropic-launches-claude-sonnet-5-at-a-steep-discount-to-its-top-model-as-the-company-races-toward-a-blockbuster-ipo))。 **最大の衝撃: 中位 Sonnet 階層で Opus 4.6 を 12pt 抜き** — **SWE-bench Verified 92.4%**(Opus 4.6 は 80.8%)、**OSWorld-Verified 88.3%**(人間専門家ベースライン 72.4% を 15.9pt 上回る)、**GPQA Diamond 96.2%**([Gemini 3.1 Pro](../columns/local-llm-landscape-2026-june-update) 94.3% 超え)、**ARC-AGI-2 84.7%**(Gemini 3.1 Pro 77.1% を 7.6pt 超え)。**1M トークンのコンテキストウィンドウ**(Opus 4.8 と同等)、出力上限 128K。 **Anthropic IPO 直前の戦略的価格設定**: **2026年8月31日まで Introductory $2 / M input・$10 / M output**、以降 Standard **$3 / $15**([Sonnet 4.6](../columns/claude-agent-sdk-credit-billing-change-2026-06-15) 同価格)。**新トークナイザで同入力が ~1.0–1.35× トークン換算** される点に注意。GPT-5.5・Gemini 3.1 Pro・自社 Opus 4.8 全てを価格で下回る。 **default model 化**: **claude.ai Free / Pro のデフォルト**、**Claude Code Pro のデフォルト**、API(`claude-sonnet-5`)/ AWS Bedrock / Vertex AI / Managed Agents 全配信チャネルで利用可。Zapier の Daniel Shepard 氏「**以前の Sonnet は途中で止まっていたタスクを Sonnet 5 は最後まで完了させる**」と評価(TechCrunch)。 **安全性**: Sonnet 4.6 より misalignment 低下、サイバー攻撃safeguards デフォルト有効、Firefox 脆弱性作成テストで **0.0% 成功率**(実用悪用不可)。 **戦略文脈**: agentic 能力は業界で「table stakes」化、競争軸は **コスト効率・信頼性・自律タスク完遂** に移行。Anthropic は IPO に向けて Opus 階層と Sonnet 階層の境界を破壊して **大量生産ワークロードでのコストパフォーマンス** を取りに来た格好。
Claude Sonnet 5
Anthropic
LLM
AI
2026-06-26
Ornith-1.0 徹底解説 — DeepReinforce が2026年6月26日に公開した『エージェント・コーディング特化』MIT オープン重みモデルファミリー 3 サイズ(9B Dense / 35B MoE / 397B MoE)、すべて262K context・Qwen 3.5 + Gemma 4 ベース・BF16 + FP8 + GGUF 提供 SWE-Bench Verified 82.4%(397B)/ 75.6%(35B)/ 69.4%(9B)、SWE-Bench Pro 62.2% で OSS 同サイズ帯 SOTA を主張 強化学習で『解の rollout だけでなく scaffolding 自体も最適化』する self-improving 設計 OpenHands / Hermes Agent / OpenClaw 互換、ClawEval ベンチも公開 — オブライト OpenClaw 利用者にも直接関係
**DeepReinforce が2026年6月26日に Ornith-1.0 を公開** しました([公式](https://deep-reinforce.com/ornith_1_0.html) / [Hugging Face コレクション](https://huggingface.co/collections/deepreinforce-ai/ornith-10))。**エージェント・コーディング特化のオープンウェイト LLM ファミリー** で、**MIT ライセンス・地域制限なし**。 **3つのサイズで提供**: [Ornith-1.0-9B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-9B)(dense、~19GB BF16)/ [Ornith-1.0-35B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-35B)(MoE)/ [Ornith-1.0-397B](https://huggingface.co/deepreinforce-ai/Ornith-1.0-397B)(MoE、Qwen 3.5 + Gemma 4 ベース)。**全サイズが 262K context**、**FP8 / GGUF 量子化版も同時公開**。 **ベンチマーク(公式公表値、同サイズ帯 OSS の SOTA を主張)**: | ベンチ | 9B | 35B | 397B | |---|---|---|---| | **SWE-Bench Verified** | **69.4%** | **75.6%** | **82.4%** | | **SWE-Bench Pro** | **42.9%** | **50.4%** | **62.2%** | | **SWE-Bench Multilingual** | — | — | **78.9%** | | **Terminal-Bench 2.1** | 43.1% | 64.2% | **77.5-78.2%** | | **NL2Repo** | 27.2% | 34.6% | **48.2%** | | **ClawEval** | — | — | **77.1%** | **設計思想**: 強化学習で **解の rollout だけでなく scaffolding(解を導くエージェント構造)自体も最適化**。自己改善型の agentic coding という、[Loop Engineering](../columns/loop-engineering-ai-agent-paradigm-2026-06) の Maker-Checker 思想と地続きのアプローチ。`<think>...</think>` ブロックでの推論モード、function calling、ツールユース対応。 **配布・運用**: vLLM ≥ 0.19.1 / SGLang ≥ 0.5.9 / Transformers ≥ 5.8.1 / Docker + llama.cpp / Ollama。OpenAI 互換 API エンドポイント。9B は単一 80GB GPU で十分、35B / 397B は **8×80GB GPU ノード(TP=8)**。エージェントフレームワーク互換: **OpenHands / Hermes Agent / [OpenClaw](../services/openclaw-setup)**(弊社サービスとも直接互換、ClawEval も同社で公式評価対象に)。 **DeepReinforce の系譜**: 強化学習を CUDA / 行列演算 / コード生成に応用してきた研究組織。過去に [CUDA-L1(3.12× 平均 GPU 高速化)](https://github.com/deepreinforce-ai/CUDA-L1)・[CUDA-L2(cuBLAS 超え HGEMM カーネル)](https://github.com/deepreinforce-ai/CUDA-L2)・**IterX(MLSys 2026 NVIDIA Track)** を発表。Ornith-1.0 はその RL ノウハウを LLM 自己改善に応用した最新作。 **位置付け**: 同時期の [Kimi K2.7-Code](../columns/kimi-k2-7-code-moonshot-ai-2026-06)(1T MoE / 32B active)・[GLM-5.2](../columns/local-llm-landscape-2026-june-update)(Intelligence Index v4.1 で 51 点 / OSS 首位)と並び、**2026年6月の agentic coding OSS 戦線の最先端**。中国系(Kimi / GLM)に対し **MIT ライセンス + 地域制限なし + 米国ベースの法務調達優位** が差別化。 **留保事項**: ベンチは DeepReinforce 自社公表値で、第三者リーダーボードでの独立検証は2026年6月26日時点で未確立。ベンダーレポート段階の数値である点には留意が必要です。 本コラム末尾に **Ornith-1.0 を含むローカル LLM の導入・PoC・継続保守の3つの問い合わせ導線** を設置しています。
Ornith
DeepReinforce
Open Weight