28 Awst 2026
Sgoriau uchel am gywiro, ond mae esbonio'n fater arall
Mae tri model newydd wedi cyrraedd sgoriau Cymraeg cryf—ond mae archwiliad o 3,712 o atebion yn dangos bod cywiro brawddeg yn llawer haws nag esbonio'r cywiriad.
Mae tri model newydd wedi cwblhau profion Cymraeg AIsteddfod yr wythnos hon. Mae'r cryfaf, Qwen3.8 2.4T-A95B, yn cyrraedd 81.09—sgôr sy'n ei roi ymhlith y pump uchaf. Ond mae archwiliad Cymraeg newydd o 3,712 o atebion yn awgrymu mai'r rhif llai trawiadol yw'r un pwysicaf: gall model gywiro brawddeg heb allu esbonio'r cywiriad yn ddibynadwy.
Canlyniadau tri model newydd
Ar 22 Awst, cafodd Qwen3.8 2.4T-A95B sgôr gyffredinol o 81.09 yn CymraegBench: 86.28 ar resymu, 75.89 ar Gymraeg ymarferol a 60.84 BLEU ar gyfieithu deddfwriaethol. Cwblhaodd bob un o'r 2,053 o achosion heb wrthod, allbwn annilys na gwall seilwaith.
Mae'r model yn fawr iawn. Yn ôl ei gerdyn model swyddogol, mae ganddo 2.4 triliwn o baramedrau i gyd, gyda 95 biliwn yn weithredol ar y tro, a ffenestr gyd-destun wreiddiol o 262,144 o docynnau. Mae'r pwysau ar gael i'w lawrlwytho, ond o dan drwydded Qwen bwrpasol; felly mae “pwysau ar gael” yn fwy cywir na'i alw'n fodel ffynhonnell agored.
Ar 27 Awst, cyrhaeddodd Qwen3.8 Flash 79.81: 84.06 ar resymu, 75.56 ar y profion ymarferol a 58.79 BLEU. Cwblhaodd 2,052 o'r 2,053 o achosion. Defnyddiodd yr un achos aflwyddiannus y lwfans cyfan o 131,072 o docynnau rhesymu heb gynhyrchu ateb terfynol. Nid yw un achos yn profi bod y model yn annibynadwy, ond mae'n dangos pam y dylai gwerthusiad gynnwys hyd yr ateb, y gost a'r gyfradd cwblhau ochr yn ochr â chywirdeb.
Yr un diwrnod, sgoriodd GLM-5.3-Flash 74.38: 76.21 ar resymu, 72.56 yn ymarferol a 58.41 BLEU. Cwblhaodd bob achos. Mae ei bwysau dan drwydded MIT yn ei gwneud yn haws ei brofi a'i addasu'n lleol, er nad yw trwydded agored ar ei phen ei hun yn gwarantu Cymraeg da.
Mae'r tri chanlyniad yn ychwanegu at canlyniad Qwen3.8 27B yr wythnos ddiwethaf. Mae A95B 10.62 pwynt yn uwch na'r 27B ar yr un harnais, ond ni ellir priodoli'r gwahaniaeth i faint yn unig: mae pensaernïaeth, hyfforddiant a’r gwasanaeth sy’n rhedeg y model hefyd yn newid.
Y bwlch rhwng gwneud a deall
Y datblygiad mwyaf defnyddiol, serch hynny, yw'r archwiliad beta o allu modelau i gywiro ac esbonio Cymraeg. Mae'n troi canfyddiad adroddiad y Coleg Cymraeg Cenedlaethol—bod modelau'n aml yn cywiro'n well nag y maent yn esbonio—yn brawf cyhoeddus, ailadroddadwy.
Profwyd 16 model ar 232 o achosion: 3,712 o atebion, ac roedd pob gwall seilwaith wedi’i ddatrys. Fable oedd ar y brig â 95.60, wedyn Sol â 93.01, Opus 5 â 92.18 a Qwen3.8 Flash â 91.92.
Ond mae edrych ar gywiro ac esbonio ar wahân yn fwy dadlennol. Ymhlith y 14 model uchaf, roedd y sgôr cywiro rhwng 8.59 a 46.87 pwynt yn well na'r sgôr esbonio. Cafodd A95B 79.69 am gywiro ond 56.25 am esbonio. Cafodd Qwen Flash 89.06 am gywiro ond 58.59 am esbonio.
Mae hynny'n bwysig mewn dosbarth, wrth olygu, ac i rywun sy'n dysgu. Os yw model yn newid ffurf dreigledig yn gywir ond yn dyfeisio rheol ramadegol i gyfiawnhau'r newid, gall yr esboniad hyderus wneud mwy o niwed na gwall amlwg.
Daeth dau batrwm arall i'r amlwg. Newidiodd iaith y cyfarwyddyd y canlyniad mewn ffordd wahanol i bob model: roedd sgôr Qwen3.8 27B 16.67 pwynt yn uwch gyda chyfarwyddyd Cymraeg, Kimi 13.33 a Grok 8.33, tra roedd sgôr DeepSeek 11.67 pwynt yn uwch gyda chyfarwyddyd Saesneg. Ac nid oedd osgoi rhif adnabod ffynhonnell ffug yn gwarantu bod cynnwys y ffynhonnell yn gywir. Mae ffurf dyfyniad a gwirionedd dyfyniad yn ddau brawf gwahanol.
Mae cyfyngiad clir i'r canlyniadau. Archwiliad beta yw hwn, gyda sgorwyr sy'n dilyn yr un rheolau bob tro, ac mae AIsteddfod yn aros am adolygiad annibynnol gan o leiaf ddau olygydd Cymraeg. Nid yw'r canlyniadau eto'n fesur terfynol o naturioldeb, tafodiaith na gwerth addysgol. Mae'r data a'r sgorwyr ar gael i eraill eu harchwilio.
Tair gwers o ieithoedd eraill
Mae datblygiadau'r wythnos mewn ieithoedd llai eu hadnoddau yn cynnig tri rhybudd ymarferol i'r Gymraeg.
Yn gyntaf, mae papur newydd ar adnabod lleferydd Baniwa, iaith Arawacaidd Frodorol, yn dangos beth y gellir ei wneud ag ychydig iawn o ddata. Mireiniwyd Whisper Small ar 1,373 o recordiadau wedi'u trawsgrifio—dim ond 32.4 munud o sain. Y canlyniad dilysu gorau oedd 37.5% WER a 7.45% CER; wrth hyfforddi'n hirach, gwaethygodd WER i 40%, arwydd tebygol o orffitio.
Mae hwn yn fan cychwyn credadwy, nid system sgwrsio barod. Geiriau unigol ac ymadroddion byr a gasglwyd oedd y data. Nid yw'r recordiadau'n gyhoeddus oherwydd perchnogaeth a mynediad cymunedol; gellir gofyn i'r ceidwaid amdanynt. Mae hynny'n ein hatgoffa nad “data ar goll” yw data cymunedol bob amser. Weithiau mae cyfyngu mynediad yn rhan o reoli'r data'n gyfrifol.
Yn ail, profodd astudiaeth meintioli modelau ar dasgau Bangla dri theulu o fodelau mewn sawl fformat. Collodd un model hyd at 57.35% o'i gywirdeb ar dasgau rhesymu o dan GGUF-W8A16, tra roedd Qwen a Llama yn fwy sefydlog o dan GPTQ. Nid nifer y didau yn unig sy'n pennu faint o gywirdeb a gollir; mae'r canlyniad hefyd yn dibynnu ar y model, y dull cywasgu a'r dasg.
Mae hynny'n uniongyrchol berthnasol i dechnoleg Gymraeg sy’n rhedeg yn lleol. Nid yw sgôr model llawn ar weinydd pell yn gwarantu sgôr y ffeil wedi'i meintioli sy'n rhedeg ar liniadur neu gyfrifiadur ysgol. Rhaid profi'r union fersiwn a ddefnyddir mewn gwirionedd.
Yn drydydd, mae TabuLM yn ychwanegu gwybodaeth am resi, colofnau a chelloedd at fodel Kinyarwanda ar gyfer ateb cwestiynau am dablau. Adroddodd sgôr o 62.0 am atebion a oedd yn cyfateb yn union, 5.7 pwynt yn well na KinyaBERT, ac roedd modelau wedi'u mireinio'n llawer gwell na GPT-4o a GPT-4o mini wrth gyfuno data.
Mae'r syniad—rhoi strwythur y dasg i'r model—yn addawol i dablau llywodraeth a gwasanaethau Cymraeg. Ond dim ond 50 o'r 106 o gwestiynau datblygu arfaethedig a gafodd eu gwerthuso, ac ni agorodd y tudalennau GitHub a Hugging Face a restrwyd yn y papur pan wiriwyd. Dull i'w brofi yw hwn, nid system barod i'w mabwysiadu.
Yr hyn a newidiodd ers yr wythnos ddiwethaf
Roedd TranslatePsy-AfriSLM, cyfres cyfieithu 19 o ieithoedd Affrica, yn rhan o erthygl yr wythnos ddiwethaf. Nid yw ei brif ganlyniadau wedi newid, felly nid oes angen eu hailadrodd. Mae dau ddiweddariad pendant: mae fersiwn newydd y papur bellach yn dweud ei fod wedi'i dderbyn i brif gynhadledd EMNLP 2026, ac mae'r casgliad Hugging Face a oedd yn methu ag agor bellach yn agor ac yn cynnwys modelau a chymysgedd synthetig 206M.
Ni ddaethpwyd o hyd i fodel, set ddata, system lleferydd na pheiriant cyfieithu Cymraeg arall yn ystod y cyfnod hwn. Chwiliwyd Nation.Cymru/Nation.Wales yn benodol, ynghyd â ffynonellau newyddion, sefydliadol ac arbenigol eraill. Ni chynhwyswyd gweithdai AI cyffredinol yng Nghymru na stori Gymraeg heb ganlyniad technoleg iaith. Ni ddaeth tystiolaeth dechnegol na datblygiad ffurfiol newydd i'r amlwg chwaith yn achos Y Dderwen ar ôl cofnod 7 Awst.
Mwy nag un sgôr sydd ei angen
Mae A95B yn gam mesuradwy ymlaen i’r Gymraeg yn y profion hyn. Mae Flash yn dangos bod pensaernïaeth sy’n defnyddio llai o baramedrau gweithredol yn gallu dod yn agos iawn. Mae GLM yn ychwanegu cymhariaeth â thrwydded MIT. Ond mae'r archwiliad cywiro ac esbonio'n ein hatal rhag troi'r sgorfwrdd yn hysbyseb.
Dylai'r prawf nesaf ofyn mwy nag “a gafodd y model yr ateb cywir?” A all esbonio'r ateb mewn Cymraeg dibynadwy? A yw'n gorffen yr ateb o fewn y terfynau cost a thocynnau? A yw'r fersiwn wedi'i meintioli yr un mor gryf? Ar ba fath o lais neu dabl y cafodd ei brofi? Pwy sy'n rheoli'r data? Pa drwydded sy'n caniatáu ei ddefnyddio?
Nid “yn cefnogi Cymraeg” yw'r canlyniad. Yr hyn sy'n cyfrif yw pa dasg Gymraeg y gall y model ei chyflawni, pa fersiwn a ddefnyddir, pa ddata a thrwydded sydd ganddo, a sut mae'n methu. Yr wythnos hon, y bwlch rhwng cywiro ac esbonio yw'r gwendid na ddylem ei guddio.
Ffynonellau a darllen pellach
- Qwen3.8 2.4T-A95B yn CymraegBench a'r cerdyn model
- Qwen3.8 Flash yn CymraegBench a Qwen3.8-Flash-Next
- GLM-5.3-Flash yn CymraegBench a'r cerdyn model MIT
- Archwiliad beta cywiro ac esbonio a'r data a'r cod
- ASR Baniwa
- Meintioli modelau Bangla
- TabuLM ar gyfer Kinyarwanda
- TranslatePsy-AfriSLM v2 a'r casgliad Hugging Face
