ATVĒRTA INICIATĪVA LATVIEŠU VALODAI

Viena valoda. Dažādi uzdevumi.

Iepazīsti Multi QA LV, teksta labošanas, EXAMs un MTEB uzdevumus, metrikas, datu kopas un vērtēšanas robežas.

Fokusā latviešu valoda Veidots izstrādātājiem Pārskatāma novērtēšana
Citi novērtējumiIegulumi · MTEB

Multi QA LV · 500 jautājumi

Lasītprasme: atbilžu izrakstīšana no Wikipedia teksta latviešu valodā. 500 jautājumi; pārskatīta pareizība 472 jautājumos, sākotnējais tokenu F1, precīza sakritība un pārklājuma diagnostikas.

Multi QA LV · 500 jautājumi
UZDEVUMS 01

Lasītprasme · tokenu F1

Salīdzina modeļa atbildes vārdus ar benchmarka atbildi visos 500 jautājumos. Daļēja sakritība dod daļēju vērtējumu; izlaisti vai lieki vārdi to samazina. Piemēram, “Rīga ir galvaspilsēta” pret “Rīga” nav pilna sakritība. F1 ir vidējais vārdu pārklājuma vērtējums 0–100, nevis pareizo atbilžu procents.

Tokenu F1 · 0–100

Pārskatīta pareizība, sākotnējā metrika vai pārklājuma diagnostika · 0–100

UZDEVUMS 02

Pārskatīta pareizība

Atbilžu pareizība pēc vienas Codex veiktas pārskatīšanas, nevis pareizrakstības vērtējums. Pieņem pārbaudītus saīsinājumus un alternatīvas atbildes; personvārdu locījumam jāatbilst jautājumam vai pilnajam atbildes teikumam. Pareizo atbilžu procentu rēķina no 472 jautājumiem, izslēdzot 28 neskaidrus jautājumus visiem vienādi. Rāda tikai izpildes ar pabeigtu pārskatīšanu; tas nav neatkarīgs cilvēku vērtējums.

Pārskatītas pareizās atbildes · %

Pārskatīta pareizība, sākotnējā metrika vai pārklājuma diagnostika · 0–100

UZDEVUMS 03

Precīza atbilde

Procenti no 500 jautājumiem, kuros visa atbilde precīzi sakrīt ar kādu benchmarka atbildi pēc burtu reģistra, pieturzīmju un atstarpju normalizēšanas. Diakritiskās zīmes saglabā. Papildu vārdi vai cits nosaukuma pieraksts var dot 0 arī saturiski pareizai atbildei.

Precīza sakritība · %

Pārskatīta pareizība, sākotnējā metrika vai pārklājuma diagnostika · 0–100

UZDEVUMS 04

Atbildes pārklājums · papildu

Cik liela benchmarka atbildes vārdu daļa ir modeļa atbildē, vidēji 500 jautājumos. Lieki vārdi vērtējumu nesamazina. Tas palīdz pamanīt garākas atbildes ar vajadzīgo informāciju, bet pilna avota kopēšana vai pretrunīga atbilde var iegūt augstu rezultātu. Šī ir papildu diagnostika, nevis pareizības vērtējums.

benchmarka tokenu atsaukšana · %

Pārskatīta pareizība, sākotnējā metrika vai pārklājuma diagnostika · 0–100

UZDEVUMS 05

Pilna atbilde izvadē · papildu

Procenti no 500 jautājumiem, kuros pilna normalizēta benchmarka atbilde atrodama modeļa izvadē kā nepārtraukta vārdu virkne. Piemēram, “Tā ir Rīga” satur atbildi “Rīga”. Nepārbauda apkārtējā teksta pareizību: “Tā nav Rīga” arī satur šo fragmentu. Šī ir papildu diagnostika.

Pilns benchmarka fragments izvadē · %

Pārskatīta pareizība, sākotnējā metrika vai pārklājuma diagnostika · 0–100