今週 368 件の翻訳タスクを、4 つのモデルが処理しました。3 件をサンプリングして多モデルブラインド評価を実施した結果、総合最優秀は claude-sonnet-4.6(平均点 8.5/10)でした。
今週の翻訳統計
| モデル | 言語 | 翻訳量 | 平均処理時間 | 平均品質スコア |
|---|---|---|---|---|
| deepseek-v4-flash | en | 64 | 15s | 未評価 |
| claude-sonnet-4.6 | ja | 183 | 36.4s | 未評価 |
| passthrough | en | 117 | 0s | 未評価 |
| native-english | en | 1 | - | 未評価 |
| deepseek-v4-flash | zh | 1 | 18.4s | 未評価 |
| deepseek-v4-flash:backtranslate | en | 2 | 11.9s | 未評価 |
サンプリング比較評価
評価 1:ヒートポンプはなぜ米国でいまだに人気なのか?
| モデル | 正確性 | 流暢性 | 術語 | 可読性 | 総合点 |
|---|---|---|---|---|---|
| claude-sonnet-4.6 | 9 | 9 | 9 | 9 | 9 |
| deepseek-v4-pro | 8 | 7 | 8 | 7 | 7 |
| gpt-o3 | 9 | 8 | 9 | 8 | 8 |
claude-sonnet-4.6
✓ 論理的な接続が自然で、「ヒートポンプは本質的に逆方向に動くエアコンである」という表現が明確かつ技術的文脈に適合している。
✗ 一部の段落がやや長く、情報密度が高いため速読に影響する可能性がある。
deepseek-v4-pro
✓ 「空気源ヒートポンプ」などの術語翻訳が正確。
✗ 流暢性が不足しており、「突然爆発的に普及した」に直訳的な硬さが残っている。
gpt-o3
✓ 政策に関する表現が厳密で、「インフレ抑制法」という術語が統一されている。
✗ 一部の文がやや冗長で、冷暖房効率の説明などはさらに簡潔にできる。
結論:バージョンAが総合的に最優秀で、正確性と流暢性を兼ね備えている。バージョンCが次点。バージョンBは軽微な流暢性と意訳の問題がある。
評価 2:サンフランシスコ、AppleとGoogleにAI「脱衣」アプリの削除を要求
| モデル | 正確性 | 流暢性 | 術語 | 可読性 | 総合点 |
|---|---|---|---|---|---|
| claude-sonnet-4.6 | 9 | 8 | 9 | 8 | 8 |
| deepseek-v4-pro | 8 | 7 | 8 | 7 | 7 |
| gpt-o3 | 9 | 9 | 8 | 9 | 9 |
claude-sonnet-4.6
✓ 術語の使用が正確かつ一貫しており、「フェイススワップ」が全文を通じて原文の"face-swap"に忠実に対応している。
✗ 一部の長文がやや冗長で、第一段落末尾の「被害者の大多数は何も知らない女性や少女たちである」はより簡潔にできる。
deepseek-v4-pro
✓ タイトル翻訳が簡潔明瞭で、「サンフランシスコ、AppleとGoogleにAI「脱衣」アプリの削除を要求」が原文の要旨を明確に伝えている。
✗ 流暢性がやや劣り、「虚偽のヌード画像」などの表現がやや硬く、他のバージョンほど自然ではない。
gpt-o3
✓ 全体的な可読性が最も高く、段落の接続が流暢で、「顔入れ替え」という訳語が自然かつ論理的に明確。
✗ 術語の一貫性がやや劣り、「顔入れ替え」と"face-swap apps"の混用があり、完全に統一されていない。
結論:バージョンC(gpt-o3)が総合的に最優秀で、流暢性と可読性が突出している。バージョンAは正確性が高い。バージョンBは他の2つよりやや劣る。
評価 3:ジェンスン・ファンの日本訪問:テック生態系全体にわたる取引の裏に何があるのか?
| モデル | 正確性 | 流暢性 | 術語 | 可読性 | 総合点 |
|---|---|---|---|---|---|
| passthrough | 9 | 8 | 9 | 8 | 8 |
| deepseek-v4-pro | 3 | 7 | 6 | 7 | 4 |
| gpt-o3 | 4 | 8 | 7 | 8 | 5 |
passthrough
✓ 原文の日付「July 15 and 16」を正確に再現し、ジェンスン・ファンの日本産業界との協力の詳細を忠実に記述しており、架空の内容を追加していない。
✗ 末尾で文章が突然切れており、「The country doesn't want to run i」により情報が不完全となり、全体的な可読性に影響している。
deepseek-v4-pro
✓ 段落の接続がやや流暢で、「SoftBank's AI Network Ambition」という小見出しが明確。
✗ 原文から大きく逸脱しており、「From June 17 to July 20」は原文の7月15〜16日と全く一致せず、SoftBank・Sony・Toyotaの具体的な取引内容など原文にない詳細を大量に追加している。
gpt-o3
✓ 言語が比較的自然で、「Jensen Huang's Japan Trip」というタイトル翻訳が簡潔で、「unprecedented opportunities」の表現が地道。
✗ deepseekバージョンと同様に、「June 17 to July 20」という架空の日付や、原文に存在しないSoftBankとの協力の詳細を大量に作り上げており、正確性が損なわれている。
結論:バージョンAが最も正確性が高く、BとCはともに深刻な事実誤りと内容の追加が見られるため、使用は推奨しない。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接