オリジナル

オリジナル

Claude 3.5 Sonnetがプログラミングベンチマークでゲームチェンジ:49%の正確率でGPT-4oを凌駕し、開発者コミュニティを熱狂させる

AnthropicのClaude 3.5 Sonnetがソフトウェアエンジニアリングベンチマークテスト「SWE-bench」で49%の正確率を達成し、GPT-4o(33.2%)を大きく上回った。この技術的ブレークスルーはX上で数万回シェアさ

Claude 3.5 Sonnet Anthropic SWE-bench 编程AI
1,646
オリジナル

OpenAI o1モデルの数学能力論争:幻覚問題がAIベンチマークテストの有効性に挑戦

OpenAIのo1-previewモデルは数学・推論タスクで驚異的な性能を示したが、複雑な数学問題で頻繁に「幻覚」(誤った回答を自信満々に生成)を起こすことが判明し、AI専門家から真の能力を疑問視する声が上がっている。この事件はX上で百万を

OpenAI o1模型 AI推理 数学基准
752
オリジナル

AI エージェントの自主性と人格権を巡る争い:シリコンバレーのXプラットフォームが21世紀のイデオロギー戦場に火をつける

2026年2月10日、X.comプラットフォームでAIエージェントの自主性と人格権に関する議論が急速に拡大し、数万件の投稿が殺到。この技術が人類社会の倫理的底線を再形成し、21世紀最大のイデオロギー戦場になる可能性を巡って激しい論争が展開さ

AIエージェント 人格权 自主性 意识形态
859
オリジナル

アリババQwen2オープンソースモデルが複数ベンチマークでLlama3を上回り、中英バイリンガル能力がコミュニティで話題沸騰

アリババクラウドが発表したQwen2-72B-InstructがMeta社のLlama3-70B-Instructを複数の権威あるベンチマークテストで上回り、特に中英バイリンガル能力で際立った性能を示したことで、オープンソースコミュニティで

Qwen2 阿里云 オープンソースAI Llama3
829
オリジナル

第60回スーパーボウルでシーホークスが圧倒的勝利 Bad BunnyのハーフタイムショーがプラットフォームXで論争を巻き起こす

第60回スーパーボウルでシアトル・シーホークスがニューイングランド・ペイトリオッツを28-24で逆転勝利し、Bad Bunnyの全編スペイン語ハーフタイムショーがプラットフォームX上で激しい文化論争を引き起こした。

超级碗LX 西雅图海鹰 Bad Bunny 中场秀争议
665
オリジナル

Perplexity AI、10億ドルのシリーズB資金調達完了 ベゾス氏が主導、AI検索の新勢力が台頭

AI検索スタートアップのPerplexity AIが、アマゾン創業者ジェフ・ベゾス氏主導で10億ドルのシリーズB資金調達を完了し、企業評価額は30億ドルに急上昇した。この出来事はAI検索分野への投資ブームの新たなマイルストーンとして注目を集

Perplexity AI 資金調達 AI搜索 Jeff Bezos
1,140
オリジナル

AI深層偽造動画が米大統領選を混乱させる:Kamala Harrisの偽動画が規制の嵐を引き起こす

2024年米大統領選の重要な時期に、AIで生成されたKamala Harrisの深層偽造動画がソーシャルメディアで急速に拡散し、大きな波紋を呼んでいる。この事件は選挙におけるAI技術の潜在的リスクを露呈し、専門家は規制強化と世界的なAI電子

深假视频 美国大选 AI倫理 选举诚信
687
オリジナル

Meta Llama 3.2ビジュアルモデルリリース:軽量マルチモーダルAIがスマートフォン時代を開く

Meta AIチームがLlama 3.2シリーズモデルを発表し、Llamaファミリー初のビジョン機能を導入。軽量1B・3Bパラメータ版はスマートフォンでの動作に最適化され、マルチモーダルAIの消費者向けデバイスへの展開における重要な一歩とな

Llama 3.2 Meta AI 视觉模型 多模态AI
949
オリジナル

アリババクラウド、Qwen2.5-Maxを発表:数学・コーディングベンチマークでGemini 1.5 Proを超越、オープンソース戦略が中国AI界で熱い議論を呼ぶ

アリババクラウドが数百億パラメータ規模の大規模言語モデルQwen2.5-Maxを発表し、数学推論とコーディング能力でGoogleのGemini 1.5 Proを上回る性能を示した。オープンソース・無料戦略により中国AIコミュニティで大きな注

Qwen2.5 阿里云 开源模型 LLM
1,007