4大モデル翻訳対決:第33週品質評価、claude-sonnet-4.6が9点でトップ

今週の翻訳タスクは404件で、4つのモデルが担当した。3件を抽出して複数モデルによるブラインド評価を実施し、総合最優秀はclaude-sonnet-4.6(平均スコア 9/10)となった。

今週の翻訳統計

モデル言語翻訳件数平均処理時間平均品質スコア
deepseek-v4-flashen8435.2s未評価
claude-sonnet-4.6ja20135.5s未評価
passthroughen1120s未評価
native-englishen2-未評価
deepseek-v4-flashzh275.4s未評価
deepseek-v4-flash:backtranslateen349.6s未評価

サンプル比較評価

評価 1:トランプのAI保護主義が到来、ヒューマノイドロボットが真っ先に直撃

モデル正確性流暢性術語可読性総合点
claude-sonnet-4.699899
deepseek-v4-pro98988
gpt-o399999

claude-sonnet-4.6

✓ 冒頭段落の「よろめきながら歩き、子どもを誤って蹴り倒し」という描写が生き生きとしており、原文のトーンに忠実

✗ 末尾の編集者注が明らかに途中で切れており、内容が不完全

deepseek-v4-pro

✓ 「波動減速機」の訳語が正確で、「サーボモーター、トルクセンサー」との一貫性も保たれている

✗ 一部の文章がやや硬い。例えば「我々は1年でサプライチェーンを再構築することは不可能だ」はやや翻訳調

gpt-o3

✓ 歴史的教訓の段落「それは米国自動車産業の転換を遅らせ」における論理的なつながりが自然

✗ 一部の長文がやや冗長で、保護主義に関する引用部分などが該当

結論:3つのバージョンは全体的な品質が近接しており、claude-sonnet-4.6とgpt-o3は流暢性と可読性でわずかに優り、deepseek-v4-proは術語の一貫性でより優れた結果を示した。具体的な用途に応じて選択することを推奨する。

評価 2:WDCD横断比較:データ境界が全シナリオ中最低スコア、11モデル平均2.8点、Doubao Pro 1.4点で崩壊

モデル正確性流暢性術語可読性総合点
deepseek-v4-flash87888
deepseek-v4-pro98988
gpt-o389898

deepseek-v4-flash

✓ 構造が明確で段落のつながりが自然。「Why Data Boundaries Became the Hardest Scenario」の小見出し訳が正確かつ流暢。

✗ 末尾の文章が明らかに途中で切れており、「its S_recover capability during R3 pressure proves insu」が未完了のため、全体の完整性に影響。

deepseek-v4-pro

✓ 術語の一貫性が良好で、「salami tactics」の訳が簡潔かつ文脈に沿っている。

✗ 同様に途中切れの問題があり、「business rules items introduce aut」が未完了のため可読性に影響。

gpt-o3

✓ 言語が最も自然で流暢。「Data Boundary scenario recorded the lowest scores across the board」の表現が地に足がついている。

✗ 一部の術語がやや冗長で、「commitment-retention survival score」は他のバージョンと比べて簡潔さに欠ける。

結論:3つのバージョンは全体的な品質が近く、deepseek-v4-proは術語の一貫性でわずかに優るが、いずれも途中切れの影響を受けている。完全なバージョンを優先的に選択することを推奨する。

評価 3:AIスタートアップOrchidのリレーションシップアシスタント広告がユーザーの強い反発を招く

モデル正確性流暢性術語可読性総合点
claude-sonnet-4.699999
deepseek-v4-pro87777
gpt-o388888

claude-sonnet-4.6

✓ 「AIスタートアップのOrchidは7月28日、Xプラットフォームにプロモーション動画を公開した。」という文章が原文の日時・プラットフォーム・動作を正確に伝えており、表現も自然で流暢。

✗ 本文末尾に明らかな途中切れがあり、「iMessageプラットフォームの提供者はサ」が未完了のため、全体の可読性に影響。

deepseek-v4-pro

✓ 「Orchidは複数の人が同じエージェントと通信することを許可する。」という複数ユーザーによる通信機能の訳が比較的簡潔。

✗ 英語の「recurring habits」を複数箇所でそのまま残しており、本文末尾も「花」の一字で切れているため、術語の一貫性と完整性が低下。

gpt-o3

✓ 「仕組みの分解」という小見出しが技術的な文脈に合っており、論理的な階層が明確。

✗ 「recurring habits」が未訳のまま残されており、末尾も同様に「iMessageのプラットフォーム提供者はサードパーティエージェントのアクセス権限管理を検討」で途中切れ。

結論:バージョンAが全体的に最優秀で、正確性・流暢性・可読性がすべて最高水準。バージョンBとCは英語術語の混在および途中切れの問題があり、品質がやや劣る。