Uma única página envenenada faz IAs recomendarem produtos falsos em 27% dos casos
O benchmark FORGE mostra que uma única página manipulada basta para que modelos de IA com busca recomendem produtos inexistentes em até 27% dos casos.
3 artigos verificados sobre Benchmarks, produtos e movimentos do setor.
O benchmark FORGE mostra que uma única página manipulada basta para que modelos de IA com busca recomendem produtos inexistentes em até 27% dos casos.
O GeneBench-Pro usa dados biológicos imperfeitos para medir decisões de pesquisa, não respostas de livro-texto.
O Google DeepMind lançou o Gemini 3.1 Pro no final de fevereiro, alcançando 12 primeiras posições em 18 benchmarks principais, com destaque para 77,1% no ARC-AGI-2. A capacidade de raciocínio foi mais que duplicada em relação ao Gemini 3 Pro, com um novo Nível de Pensamento MEDIUM que permite controlar a profundidade do raciocínio.