Rezultātiem ir vajadzīgs pamatojums.
Atklāta valodas un iegulumu modeļu novērtēšanas metodoloģija: datu atlase, reproducējamas konfigurācijas, rezultātu un izmaksu ierobežojumi.
Kā iegūstam un salīdzinām rezultātus
Pašreizējās datu kopas, vērtēšanas noteikumi un mērījumu robežas.
Viens rezultāts raksturo konkrētu pārbaudi
Salīdzinām modeļus latviešu valodas uzdevumos. Multi QA LV mēra lasītprasmi ar dotu tekstu; teksta labošana — sakritību ar sagaidāmo labojumu; EXAMs — izvēles jautājumu atbilžu precizitāti. Iegulumu modeļiem ir atsevišķa MTEB pārbaude. Skalā 0–100 augstāks vērtējums ir labāks, taču vienāda skaitliskā vērtība dažādos benchmarkos nenozīmē vienādu spēju līmeni.
| Novērtējums | Apjoms | Galvenais vērtējums |
|---|---|---|
| Multi QA LV | 500 jautājumi; pārskatītajā vērtējumā 472 | Tokenu F1 pēc noklusējuma; pārskatīta pareizība un precīza sakritība pieejamas atsevišķi |
| Teksta labošana | 250 teikumi | Trīs metriku vienādi svērts vidējais |
| EXAMs · izstrādē | 60 valodas un 26 matemātikas jautājumi | Pareizo atbilžu īpatsvars katrā priekšmetā |
| Iegulumi · MTEB | 6 mērījumi | Uzdevuma metrika un pilnas atlases vidējais |
- Salīdzini vienā kopā un vienā metrikā. Līderu tabula sakārtota pēc izvēlētā uzdevuma. Nav viena kopēja visu benchmarku rezultāta.
- Trūkstošs vērtējums nav nulle. Galīgo metriku aprēķina tikai ar pilnu tās uzdevumu pārklājumu. API kļūmes paliek kā trūkstošas atbildes. Saņemta tukša, atteikta vai tokenu limita dēļ aprauta atbilde tiek vērtēta kā neveiksme atbilstoši konkrētās kopas noteikumiem.
- Tabulā ir izpildes konfigurācijas. Parasti redzamas pabeigtas izpildes ar vērtējumu. Apzināti iekļautiem izņēmumiem ir piezīme modeļa detaļās; trūkstošus punktus neizdomājam.
- Neliela starpība vēl nepierāda pārākumu. Vietne nerāda uzticamības intervālus vai vairāku neatkarīgu atkārtojumu vidējos. Mazās kopās daži uzdevumi var būtiski mainīt secību.
Multi QA LV: atrod atbildi dotajā tekstā
Izmantojam MultiWikiQA latviešu valodas daļu: Wikipedia rakstu tekstus un sākotnējā datu kopā ar Gemini 1.5 Pro ģenerētus jautājumus. Vietnē salīdzinām 500 jautājumus par 500 dažādiem rakstiem — vienu jautājumu no katra raksta.
Rakstus sadala piecās grupās pēc teksta garuma un no katras deterministiski atlasa 100 rakstus; arī jautājuma izvēle izmanto fiksētu SHA-256 kārtošanu. Atlase neizmanto modeļu rezultātus vai sagaidāmo atbilžu saturu. Šī atlase līdzsvaro rakstu garumus, tāpēc tās rezultātus nevar vispārināt uz visu avota datu kopu.
Katram jautājumam modelis saņem pilnu raksta fragmentu un jautājumu latviešu valodā. Instrukcija prasa nokopēt īsāko fragmentu, kas pilnībā atbild uz jautājumu. Piemēri, sagaidāmās atbildes, meklēšana un ārēji rīki netiek doti. Ievadi lokāli nesaīsinām; ja tā pārsniedz nodrošinātāja limitu, pieprasījums paliek nepabeigts.
Pārskatīta atbilžu pareizība
Galvenajā tabulā un izmaksu salīdzinājumā pēc noklusējuma rāda tokenu F1 visos 500 jautājumos. Atsevišķā cilnē pieejama pārskatīta pareizība: pareizo atbilžu īpatsvars 472 jautājumos, nevis pareizrakstības vērtējums. Pārskatīšanas versijā multiwikiqa-reviewed-accuracy-v1 28 neskaidrus vai dotajā tekstā nepamatotus jautājumus izslēdz vienādi visiem modeļiem. Labojami nepareizi atbilžu benchmarki ir koriģēti šajā vērtējumā, saglabājot sākotnējos datus. Izpildes ar nepabeigtu pārskatīšanu šajā cilnē neiekļauj; to automātiskās metrikas paliek pieejamas.
Codex ir pārskatījis saglabāto pilno atbilžu variantus. Pieņem pārbaudītus saīsinājumus, pietiekamas īsākas atbildes un papildu tekstu, kas nemaina atbildes nozīmi. Personvārda locījumam jāatbilst jautājumam vai pilnajam atbildes teikumam. Piemēram, uz “Kura persona…?” pieņem “Z. Liepiņš” un “Zigmars Liepiņš”, bet nepieņem atsevišķu “Zigmara Liepiņa”. Pēc jautājuma “Kurai spēlētājai…?” pareizs pilns teikums “A. Jēkabsone-Žogota kļuva par WNBA čempioni” ir pieņemams, jo nominatīvs šajā teikumā ir gramatiski pareizs.
Šī ir viena AI veikta pēcapstrādes pārskatīšana, nevis neatkarīga cilvēku anotācija. Tā mēra atbildes pareizību, nevis sākotnējās īsākā fragmenta kopēšanas instrukcijas izpildi. Lēmumi piesaistīti jautājuma, teksta un pilnās atbildes saturam; tikai pareizā vārda klātbūtne izvadē nedod punktus. Jaunam nepārskatītam atbildes variantam galīgo pārskatīto rezultātu nepiešķir, kamēr tas nav izvērtēts. Tukšas, atteiktas un aprautas atbildes saņem nulli.
Divas sākotnējās metrikas
- Tokenu F1
- Atbildes un sagaidāmās atbildes kopīgo tokenu līdzsvars:
100 × 2 × kopīgie tokeni / (atbildes tokeni + sagaidāmās atbildes tokeni). Tokeni ir ar atstarpēm atdalīti vārdi; atkārtojumus skaita. Lieki vārdi var samazināt rezultātu. - Precīza sakritība
- 100 par pilnīgi sakrītošu normalizētu atbildi, citādi 0. Katra jautājuma labāko vērtējumu izvēlas starp pieejamajām sagaidāmajām atbildēm; pēc tam aprēķina visu jautājumu aritmētisko vidējo. Tas pats labākās atbildes princips attiecas uz F1.
Pirms abām pārbaudēm tekstu normalizē Unicode NFC formā, ignorē burtu reģistru, noņem Unicode pieturzīmes un vienādo atstarpes. Diakritiskās zīmes, cipari un simboli saglabā nozīmi. Paskaidrojumus no modeļa atbildes neizgriežam; vērtējam atdoto tekstu.
Divas papildu diagnostikas
Atbildes pārklājums rāda, cik liela sagaidāmās atbildes tokenu daļa ir izvadē, ņemot vērā atkārtojumus. Pilna atbilde izvadē pārbauda, vai visa normalizētā sagaidāmā atbilde atrodama izvadē kā secīga tokenu virkne. Arī šeit ņem labāko variantu un vidējo visos jautājumos.
Šīs diagnostikas nesoda liekus vārdus un nepārbauda pretrunas. Visa avota teksta kopēšana var iegūt augstu vērtējumu. Tās neaizstāj F1 vai precīzu sakritību un nav semantiskas pareizības vērtējums.
Apkopotos vērtējumus piešķir tikai pēc visām 500 atbildēm. Sākotnējās metrikas un abas diagnostikas aprēķina automātiski visos 500 jautājumos; nederīgas saņemtās atbildes saņem nulli. Pārskatītajam rezultātam papildus vajadzīgi lēmumi par visām 472 iekļautajām atbildēm. Kopēju šo atšķirīgo metriku vidējo neaprēķinām. Pārskatīšana izmanto saglabātās atbildes, bez jauniem modeļu API pieprasījumiem.
Robežas: publiski Wikipedia teksti un ģenerētie jautājumi var būt apmācības datos. Sakritība ar sagaidāmo fragmentu var noraidīt derīgu alternatīvu atbildi. Šis ir mūsu lokālais zero-shot protokols, kura rezultāti nav tieši salīdzināmi ar EuroEval.
Teksta labošana: 250 bojāti teikumi
Kopā ir 250 pāri no Likumi.lv tekstiem: bojāts teikums un tam atbilstošs pareizais variants. Bojājumos ietilpst pieturzīmju un reģistra zudums, kā arī sintētiskas vārdformu un diakritisko zīmju kļūdas. Modelis saņem tikai bojāto teikumu un labošanas instrukciju. Pareizais variants un kļūdu anotācijas paliek vērtētājam.
Jāatjauno pieturzīmes, lielie burti, gramatika un diakritiskās zīmes, saglabājot nozīmi, faktus, skaitļus un stilu. Atbildē jābūt tikai labotajam teikumam. Normalizējam NFC un atstarpes; reģistrs, pieturzīmes un diakritiskās zīmes tiek vērtētas. Paskaidrojumus, pēdiņas un Markdown automātiski nenoņemam.
- Precīza sakritība
- Teikumu procentuālais daudzums, kuri pēc normalizēšanas pilnīgi sakrīt ar pareizo variantu.
- Rakstzīmju līdzība
- Katram teikumam
100 × (1 − Levenšteina attālums / garākā teksta garums); pēc tam visu teikumu vidējais. Attālums skaita minimālās rakstzīmju ievietošanas, dzēšanas un aizstāšanas operācijas. - Labojumu F0,5
- Salīdzina veiktos tokenu labojumus ar sagaidāmajiem. Pareizie labojumi (TP), papildu vai nepareizie (FP) un neizdarītie (FN) tiek saskaitīti visā kopā:
100 × 1,25 TP / (1,25 TP + 0,25 FN + FP). Lielāks svars ir labojumu precizitātei, lai sodītu nevajadzīgas izmaiņas. Ja nav ne vajadzīgu, ne veiktu labojumu, vērtējums ir 100. - Kopējais vērtējums
(precīza sakritība + rakstzīmju līdzība + labojumu F0,5) / 3. Visām trim kopas metrikām ir vienāds svars. F0,5 vispirms aprēķina no visas kopas labojumiem, nevis kā atsevišķu teikumu F0,5 vidējo.
Kā sakrīt tokenu labojumi?
Vārdus un katru pieturzīmi uzskata par tokeniem. Izmanto minimālā Levenšteina attāluma izlīdzinājumu; vienādas cenas gadījumā prioritāte ir aizstāšana, dzēšana, ievietošana. Blakus esošās izmaiņas apvieno līdz nākamajam nemainītajam tokenam. Labojums sakrīt tikai ar to pašu avota tokenu posmu un aizvietojuma tokeniem. Tas ir mūsu versēts salīdzinātājs, nevis ERRANT/M2 vai neatkarīga gramatikas pārbaude.
Visus vērtējumus aprēķina tikai pēc 250 atbildēm. Tukša, atteikta vai aprauta atbilde saņem nulli precīzajā sakritībā un rakstzīmju līdzībā; labojumu uzskaitē tai nav pareizu labojumu, visi sagaidāmie labojumi ir izlaisti un pievieno vienu kļūdainu labojumu.
Robežas: viena pareizā varianta izmantošana var sodīt citus derīgus labojumus. Neliela, sintētiski bojāta juridisko tekstu kopa neatspoguļo visas dabiskās kļūdas vai visus latviešu valodas stilus. Vērtējumi mēra sakritību ar pareizo variantu, nevis cilvēka apstiprinātu gramatiku vai nozīmes saglabāšanu. Publiskie avoti var būt apmācības datos.
EXAMs: piesātināts benchmarks izstrādē
Daudzi modeļi sasniedz augstus rezultātus, tāpēc šī atlase vāji nošķir spēcīgākos modeļus. Tā ir papildu pārbaude; modeļa izvēlei vispirms salīdzini Multi QA LV, teksta labošanu un izmaksas.
Atlasīti VIAA 2024.–2026. gada augstākā līmeņa eksāmenu jautājumi ar vienu pareizo burtoto atbildi: 60 latviešu valodā un literatūrā un 26 matemātikā. Nevērtējam domrakstus, pierādījumus, zīmējumus un pārējos atvērtās atbildes uzdevumus. Matemātika izmanto oriģinālo lapu attēlus un prasa attēlu ievadi. Atbilžu atslēgas un pārbaudes attēlus modelim nedod.
| Mācību gads | Latviešu valoda un literatūra | Matemātika |
|---|---|---|
| 2023/2024 | 20 | 15 |
| 2024/2025 | 20 | 8 |
| 2025/2026 | 20 | 3 |
Viens punkts par pareizo burtu, citādi nulle. Priekšmeta vērtējums ir 100 × pareizās atbildes / atlasītie jautājumi. Pašreizējais vērtētājs pieņem nepārprotamu burtu atbildes pirmajā vai pēdējā rindā, arī ar “Atbilde:” vai “Answer:” norādi, vienkāršu Markdown vai noslēdzošu punktu/iekavu. Paskaidrojums drīkst būt blakus; atbildes burtu no paskaidrojuma teksta neizsecina. Pretrunīgi atsevišķi atbilžu burti, neatļauts variants, atteikums vai aprauta atbilde saņem nulli.
Atsevišķi saglabājam formāta atbilstību — cik atbilžu ir tikai viens atļautais burts. Tas ir diagnostikas rādītājs, kas nemaina atbildes precizitāti. Katram priekšmetam vajadzīgas visas izvēlētā gada vai visu gadu atbildes. Visu gadu rezultāts apvieno jautājumus, nevis gadu procentu vidējos; matemātikā gadiem tādēļ ir atšķirīgs svars. Abu priekšmetu kopvērtējuma nav.
Robežas: īpaši mazais matemātikas uzdevumu skaits ierobežo secinājumus. Publiski eksāmeni var būt apmācības datos. Rezultāts neapliecina visa eksāmena nokārtošanu un nevērtē brīvi rakstīta teksta kvalitāti.
Izmaksas aprēķinām no saglabātā patēriņa
Izmaksu sadaļa aptver Multi QA LV, teksta labošanu un EXAMs. Tā izmanto nodrošinātāja atbildē saglabāto tokenu patēriņu un mūsu tarifu tabulu USD, nevis konta rēķinu. Tarifu pārbaudes datumi un avoti pieejami izmaksu skatā un izpildes detaļās. Pārbaudām arī atbildē atgriezto modeļa ID un nodrošinātāja adreses atbilstību tarifam.
Ievades tokenus sadala parastajos, no kešatmiņas lasītajos un kešatmiņā rakstītajos, katram piemērojot attiecīgo tarifu. Izvades patēriņā spriešanas tokenus iekļauj vienu reizi. Ja patēriņš ir nepilnīgs, modelim nav derīga tarifa vai nezināms vajadzīgais kešatmiņas tarifs, cenu nerādām kā nulli.
- Par jautājumu vai teikumu
- Pilnas izpildes aprēķinātās izmaksas dalītas ar tās saglabāto atbilžu skaitu. Dažādus benchmarkus, EXAMs priekšmetus un gadus salīdzina atsevišķi.
- Par precīzu atbildi vai labojumu
- Multi QA LV un teksta labošanai — izmaksas dalītas ar precīzo sakritību skaitu. EXAMs — ar pareizo burtoto atbilžu skaitu. F1 un teksta labošanas kopvērtējumu neizmanto par pareizo atbilžu procentu. Ja nav nevienas pareizas atbildes, šo cenu nevar aprēķināt.
- Labākā cenas un rezultāta attiecība
- Atlasa izpildes, kurām tajā pašā novērtējumā nav citas izpildes ar zemāku vai vienādu cenu un vienlaikus augstāku vai vienādu rezultātu, vismaz vienam rādītājam esot labākam. Aprēķins izmanto izvēlēto metriku, datu apjomu un izmaksu mērogu pirms modeļu un nodrošinātāju filtriem. Vienādi punkti saglabājas.
Salīdzinājumā iekļauj tikai izpildes ar pilnu vērtējumu. Ja cena trūkst, izpilde var palikt tabulā, bet grafikā cenu neizdomājam. Budžeta un zināmas cenas filtri šādas izpildes izslēdz.
Aprēķins neietver atkārtotu neveiksmīgu pieprasījumu izmaksas, nodokļus, kredītus, bezmaksas kvotas un konta atlaides. Tas nav ātruma, lokālas aparatūras vai kopējo uzturēšanas izmaksu salīdzinājums. Dažādi tokenizētāji, ievades garumi, spriešana un tarifu izmaiņas ietekmē rezultātu; mazāka cena šajā kopā negarantē mazāku cenu katram reālam uzdevumam.
Iegulumu modeļu novērtēšana
Iegulumi · MTEB
Izmantojam MTEB(Multilingual, v1) tikai ar latviešu valodas lav-Latn un lvs-Latn apakškopām; divvalodu apakškopas izslēdzam. Iegulumi pārvērš tekstu vektoros, un uzdevumu vērtēšanu veic MTEB. Katru sākotnējo main_score pārveidojam skalā 0–100.
- BelebeleRetrieval: meklēšanas kvalitāte ar nDCG@10.
- MassiveIntentClassification: klasifikācijas precizitāte validācijas un testa sadalījumos, katrā atsevišķi.
- MultiEURLEXMultilabelClassification: MTEB galvenā accuracy metrika vairāku tēmu klasifikācijai.
- SIB200ClusteringS2S un WikiClusteringP2P.v2: klasterēšanas V-measure.
Vidējais ir visu sešu mērījumu vienādi svērts aritmētiskais vidējais un parādās tikai ar visiem sešiem rezultātiem. MassiveIntent abi sadalījumi tādēļ kopā saņem divas sestdaļas svara. Šis ir konkrētās atlases kopsavilkums, nevis universāls iegulumu kvalitātes mērs.
Ievades apstrāde ir atkarīga no izpildes konfigurācijas: OpenAI adapteris izmanto 8191 tokena robežu un nulles vektoru tukšam tekstam; Google/Vertex izmanto nodrošinātāja saīsināšanu, bet Hugging Face — modeļa tokenizētāju, garuma limitu un konfigurētos prefiksus. Tāpēc nav viena kopīga ievades limita vai prefiksa visiem modeļiem; to atšķirības jāņem vērā salīdzinājumā.
Kas ir viena izpilde un ko publicējam
Rezultātam saglabājam datu kopas kontrolsummu, protokola versiju, modeļa ID un norādīto revīziju, nodrošinātāju, ievades režīmu un izmantotos ģenerēšanas ierobežojumus. Atkarībā no kopas konfigurācijā ir arī gads un priekšmets. Iegulumiem papildus fiksē MTEB versiju, datu revīzijas, dimensijas, sēklu un ievades apstrādi.
Izpildes ID iegūst no konfigurācijas SHA-256. Tas nav rezultāta kvalitātes rādītājs vai jauns modelis. Dažādi ID ar vienādiem punktiem var nozīmēt atšķirīgu nodrošinātāju, ievades limitu, revīziju, priekšmetu vai citu iestatījumu. Atkārtota palaišana ar to pašu konfigurāciju parasti turpina saglabāto izpildi; tā automātiski nav jauns neatkarīgs mērījums.
Valodas modeļu pieprasījumi neizmanto rīkus vai ārēju meklēšanu. Spriešanas intensitāti palaišanas kods tieši nenosaka; lietotāja saskarnē norādītais Thinking ir zināmais nodrošinātāja noklusējums konkrētajai modeļa un adreses kombinācijai vai default, unverified. Tas nav mērījums tam, cik modelis faktiski spriedis. API modeļa aizstājvārds vai norāde alias negarantē nemainīgu modeļa versiju un identisku nākamo atbildi.
Atvērto un slēgto svaru modeļiem vienā benchmarkā piemēro tos pašus vērtēšanas noteikumus. Parametru filtrs rāda kopējo svaru parametru skaitu, nevis tikai MoE aktīvos parametrus; nezināmu skaitu atzīmē kā nezināmu. Šie grupējumi neaizstāj izpildes konfigurācijas pārbaudi.
Publicēšanu izvēlamies katrai izpildei atsevišķi. Vietnē nonāk tikai apstiprināto izpilžu tabulās, grafikos un detaļās redzamie apkopotie vērtējumi un izmaksu dati. Jauna izpilde pēc noklusējuma ir privāta; pirms izvietošanas publisko atlasi pārskata cilvēks. Tas nenozīmē, ka katru modeļa atbildi ir novērtējis cilvēks.
Vietne ir priekšskatījuma stadijā. Pilnie rezultātu JSON, izpildes konfigurācijas, oriģinālās modeļu atbildes un datu kopu lejupielādes vēl nav publiski pieejamas. Koda repozitorija saite būs pieejama drīzumā. Avotu teksti var būt modeļu apmācības datos; nevienam no šiem rezultātiem nepiedēvējam garantētu apmācības datu nepārklāšanos.
Pašreizējo protokolu identifikatori
- Multi QA LV
multiwikiqa-lv-zero-shot-v1- Papildu atbilžu diagnostika
multiwikiqa-answer-coverage-v1- Teksta labošana
lv-text-fix-reference-v1- EXAMs
exams-mcq-v1, vērtēšanamcq-explicit-answer-v2