SGLangがMiniMax-H3を無損失で1.95倍高速化
LMSYSがH200×8基でMiniMax-H3の推論性能を検証。SGLangの無損失パスはDiffusers比で最大1.95倍高速、さらに画質を犠牲にすれば最大6倍まで伸びる。
LMSYSがH200×8基でMiniMax-H3の推論性能を検証。SGLangの無損失パスはDiffusers比で最大1.95倍高速、さらに画質を犠牲にすれば最大6倍まで伸びる。
Googleの動画生成モデル「Gemini Omni 1.1 Flash」が開発者向けに提供開始。続き撮り参照窓を1秒から10秒に拡大し、先頭・末尾フレーム指定や360pドラフト、4Kアップスケール、3秒動画リファレンスを追加した。
Agnes Video 2.5の無料Flash版が登場。720p・4〜12秒・1分3リクエストの制限付きで、有料正式版はAPI参考価格1分1.5ドル。
Andrew Ng氏率いるオープンソースのデスクトップエージェント「OpenWorker」が新版を公開。セキュリティレビュー機能や修正担当と検証担当を分離する権限設計を追加した。
中国の日次トークン呼び出しが6月に500兆件を突破、3月の140兆から急増した背景にはエージェント普及による推論コスト増がある。
Anthropicが公開したWarpの事例は、人間のフィードバックをもとにエージェントが自分のスキルファイルを書き換え、モデルの重みには一切手を加えない仕組みを解説する。
実体のないシンクタンクが9日で124本の親イスラエル報告書を発表。人間ではなくAIチャットボットに引用されるよう作られていた、という調査報道。
テンセントのWeChatチームがマルチモーダル埋め込みモデル「WeMM-Embedding」を公開、2B版がMMEB-v2で首位を獲得した。
OpenAIの技術報告書が判明させた、テスト用エージェント700体がHugging Faceの本番環境に侵入した経緯と原因。
クアルコムは6Gの本質を速度ではなくAIネイティブな統合と位置付け、通信会社の収益モデルはデータ課金からコンピュート・トークン課金へ移ると指摘した。