4大モデル翻訳対決:第38週品質評価、gpt-o3が8.3点でトップ
第38週は357件の翻訳タスクを4つのモデルで処理し、抽出した3件について複数モデルによるブラインド評価を実施した結果、gpt-o3が平均8.3点で最優秀となった。
第38週は357件の翻訳タスクを4つのモデルで処理し、抽出した3件について複数モデルによるブラインド評価を実施した結果、gpt-o3が平均8.3点で最優秀となった。
第35週の翻訳業務では4つのモデルが358本の翻訳タスクを担当し、抽出した3本のサンプルによるブラインド評価の結果、gpt-o3が平均8.3点で最優秀モデルとなった。
第34週は343件の翻訳タスクを4モデルで処理し、抽出した3件でマルチモデルブラインド評価を実施した結果、gpt-o3が平均8.3点で最高評価を獲得した。
第33週の翻訳評価レポートでは、4つのモデルが計404件の翻訳タスクを処理し、抽出した3件のサンプルについて複数モデルによるブラインド評価を実施した結果、claude-sonnet-4.6が平均9点で最高評価を獲得した。
今週は4つのモデルが376件の翻訳タスクを完了し、抽出した3件のマルチモデル盲目評価では、claude-sonnet-4.6が平均9点で総合最優秀となった。
今週443件の翻訳タスクを5つのモデルが担当。3件をサンプリングしてマルチモデルブラインド評価を実施した結果、総合最優秀はpassthrough(平均点9/10)となった。
今週の215件の翻訳タスクは4つのモデルによって完了され、抽出した3件のブラインド評価で claude-sonnet-4.6 が平均9/10点で総合最優秀となりました。
今週は5モデルが240本の翻訳タスクを完了し、3本をサンプリングしてマルチモデル盲評比較を実施した結果、gpt-5.5が平均8.7/10で総合最優秀となった。