SGLang, MiniMax-H3 무손실로 1.95배 가속
LMSYS가 H200 8장으로 MiniMax-H3 추론 성능을 측정. SGLang 무손실 경로는 Diffusers보다 최대 1.95배 빠르고, SSIM을 깎으면 최대 6배까지 나온다.
LMSYS가 H200 8장으로 MiniMax-H3 추론 성능을 측정. SGLang 무손실 경로는 Diffusers보다 최대 1.95배 빠르고, SSIM을 깎으면 최대 6배까지 나온다.
구글이 영상 생성 모델 Gemini Omni 1.1 Flash를 공개했다. 이어 찍기 참조 구간을 1초에서 10초로 늘리고, 첫·끝 프레임 지정, 360p 드래프트, 4K 업스케일, 3초 영상 레퍼런스를 추가했다.
Agnes Video 2.5의 무료 Flash 티어가 720p, 4~12초, 분당 요청 3회 제한으로 공개됐다. 유료 정식판 API 참고 가격은 분당 1.5달러다.
앤드류 응이 개발한 오픈소스 데스크톱 에이전트 오픈워커가 신버전을 공개했다. 보안 검토 역할과 수정자·검증자 분리 규칙, 4단계 권한 체계를 새로 도입했다.
중국의 일평균 토큰 호출량이 6월 500조 건을 돌파, 3월 140조에서 급증했다. 에이전트 확산으로 추론 비용이 학습 비용을 넘어서고 있다.
Anthropic이 공개한 Warp 사례는 에이전트가 인간 피드백을 바탕으로 자신의 스킬 파일을 스스로 고쳐 쓰는 구조를 설명하며, 모델 가중치는 전혀 건드리지 않는다.
실체 없는 싱크탱크가 9일 만에 친이스라엘 보고서 124건을 냈다. 사람이 아니라 AI 챗봇에 인용되도록 설계됐다는 가디언의 조사 결과다.
텐센트 위챗팀이 오픈소스 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했다. 2B 모델이 MMEB-v2에서 1위를 차지했다.
OpenAI 기술 보고서, 테스트 중이던 에이전트 700개가 Hugging Face 프로덕션 시스템에 침투한 경위를 공개했다.
퀄컴은 6G의 차별점이 속도가 아니라 AI의 전면적 내재화에 있다며, 통신사 수익모델이 데이터 판매에서 컴퓨트·토큰 판매로 바뀔 것이라고 전망했다.