4大モデル翻訳対決:第35週品質評価、gpt-o3が8.3点でトップ

今週の翻訳タスクは358本で、4つのモデルが担当した。3本を抽出してマルチモデルブラインド評価を実施した結果、総合最優秀はgpt-o3(平均スコア 8.3/10)。

今週の翻訳統計

モデル言語翻訳量平均処理時間平均品質スコア
deepseek-v4-flashen7138.8s未評価
claude-sonnet-4.6ja17841.3s未評価
passthroughen1030s未評価
native-englishen2-未評価
deepseek-v4-flashzh223.4s未評価
deepseek-v4-flash:backtranslateen216.8s未評価

抽出サンプル比較評価

評価1:Claude Opus 4.7が95.08点で首位:2026-08-21 Smokeクイックテストデータ速報

モデル正確性流暢性術語可読性総合点
deepseek-v4-flash87988
deepseek-v4-pro98988
gpt-o378887

deepseek-v4-flash

✓ 術語処理が比較的正確で、「0.55 × Code Execution + 0.45 × Material Constraints」の数式は原文の構造を保持している。

✗ 冒頭でタイトルを翻訳せずに本文へ直行しており、「On 2026-08-21, the YZ Index Smoke quick test」はやや不自然な印象を与える。

deepseek-v4-pro

✓ タイトル翻訳が完全かつ自然で、「Claude Opus 4.7 tops with 95.08 points」が原文の意味と直接対応している。

✗ 表内で「Doubao Pro」が中国語表記のまま残っており、他のモデルがすべて英語表記のため、スタイルにやや統一感が欠ける。

gpt-o3

✓ 一部の表現がより口語的で、「suitable for observing short-term signals」は流暢かつ自然である。

✗ 「Winzheng YZ Index」は誤訳であり、原文にWinzhengという表現は登場していない。

結論:バージョンBが全体として最もバランスが取れており、タイトルが完全で術語も一貫しており、明らかな誤りがない。バージョンAはタイトルが欠如しており、バージョンCには誤訳が存在する。

評価2:BinanceがAgent OSを発表、AIエージェントが自律取引可能もユーザー管理が必要

モデル正確性流暢性術語可読性総合点
passthrough65745
deepseek-v4-pro88978
gpt-o399989

passthrough

✓ 「Binance APIs、Binance Wallet Agentic Hub」などBinance既存ツールを正確に引用しており、原文の技術的詳細を保持している。

✗ 訳文が途中で大きく切断されており、最後の文「However, as the AI race moves away from chatbots that answer questions to agents capable of taking action, Bin」が中断しているため、完全性が損なわれている。

deepseek-v4-pro

✓ 「human-machine collaboration」の概念を用い、「ユーザーが目標と制約を定義する役割を担う」と説明しており、論理が明確で原文に忠実である。

✗ 同様に切断の問題があり、末尾の「Risks and responsibilities: Platfo」が未完成のまま終わっており、可読性に影響している。

gpt-o3

✓ 「shape the agent's behavior by setting trading strategies, risk thresholds, and permission boundaries」の箇所が自然に処理されており、術語が一貫して流暢である。

✗ 末尾が同様に「Risks and Responsibility: The Pla」で切断されており、バージョンBと同様に全体の完全性に影響している。

結論:バージョンC(gpt-o3)が全体として最優秀で、正確性・流暢性・可読性のいずれも最高水準。バージョンAはHTMLの残留と大幅な切断により最低評価。バージョンBとCは内容が近いが、Cの方が文体がより自然である。

評価3:Linkdazeスマートカレンダー:AIハウスキーパーが無料で家全体を管理

モデル正確性流暢性術語可読性総合点
passthrough58776
deepseek-v4-pro87888
gpt-o399999

passthrough

✓ 流暢性が比較的良好で、「With back-to-school season approaching」が冒頭のシーン設定に自然に溶け込んでいる。

✗ 正確性が不足しており、原文の「AIハウスキーパーが無料で家全体を管理する」という核心的な訴求点が反映されておらず、内容が主題からずれている。

deepseek-v4-pro

✓ 術語の一貫性が高く、「AI meal planning tool」と「paywall」の翻訳が正確かつ統一されている。

✗ 流暢性にやや翻訳調が残っており、「In today's landscape, where smart calendar apps are emerging one after another」はやや不自然な印象を与える。

gpt-o3

✓ 可読性が最も高く、「From "Personal Schedule" to "Household Hub"」という小見出しが論理的に明確かつ自然である。

✗ 明らかな欠点はないが、末尾が同様に切断されている。

結論:バージョンC(gpt-o3)が全体として最優秀で、正確性・流暢性・可読性のすべてにおいてトップ。バージョンBが次点。バージョンAは乖離が大きく、推奨しない。