2025-08-17 00:53:21

Os benchmarks de IA não funcionam da maneira que deveriam.

Um novo sistema permite que as pessoas decidam o que realmente importa ao julgar modelos. Pode ser algo crítico, como garantir a conformidade para a segurança humana, ou algo pequeno, como evitar travessões em texto.

Com este sistema, você projeta os testes.

DON2.76%

WORK3.12%

IN17.54%

Ver original

Esta página pode conter conteúdo de terceiros, que é fornecido apenas para fins informativos (não para representações/garantias) e não deve ser considerada como um endosso de suas opiniões pela Gate nem como aconselhamento financeiro ou profissional. Consulte a Isenção de responsabilidade para obter detalhes.

11 Curtidas