Gwerthuso AI yn y Gymraeg
Pa mor dda y mae'r peiriannau'n defnyddio'r Gymraeg? Gan nad oes sgorfwrdd cyhoeddus arall, rydym yn cofnodi'r canlyniadau yma.

Dyma'r bwlch a'n sbardunodd i sefydlu'r AIsteddfod: nid oes yr un o'r prif labordai — OpenAI, Anthropic, Meta, xAI, Moonshot, Zhipu na DeepSeek — yn cyhoeddi canlyniadau meincnodi ar gyfer y Gymraeg. Dim ond tua 10–15 o ieithoedd sydd fel arfer yn eu tablau amlieithog, ac nid yw'r Gymraeg yn eu plith. Daw bron pob adnodd meintiol ar gyfer gwerthuso'r Gymraeg o waith academaidd ym Mhrydain: BritLLM/UK-LLM yn UCL, Techiaith ym Mhrifysgol Bangor, a Cardiff NLP. Ceir catalog llawn ar dudalen y setiau profion, a manylion y protocolau a'r dulliau sicrhau ansawdd yn ein methodoleg.
Mae maint y bwlch yn amlwg yn y data hyfforddi. Dim ond tua 0.065% o ddata PaLM oedd yn Gymraeg, a thua 0.00177% yn unig o ddata hyfforddi GPT-3, yn ôl ffigurau Prys a Jones drwy Techiaith. Ychydig iawn o ddeunydd Cymraeg, felly, sydd wrth wraidd y galluoedd a fesurir isod.
CymraegBench v0.1: y deuddeg model blaenllaw
Mae'r brif sampl bellach yn cynnwys 23,708 o ymatebion gan y deuddeg model uchaf ar 19 o setiau profion Cymraeg, ac mae pob gwall seilwaith wedi'i ddatrys. Defnyddiwyd hyd at 100 o achosion o bob set, wedi'u dewis drwy ddull sy'n rhoi'r un achosion bob tro, ag hedyn hap 1 lle'r oedd y darparwr yn ei gynnal, a'r un harnais ar gyfer pob model. Mae'r canlyniadau cyfanredol, sgoriau pob set a'r manylion sydd eu hangen i ailadrodd y profion ar gael yn agored yn BangorAI/cymraeg-bench.
| Safle | Model | Sgôr gyffredinol | Rhesymu Cymraeg | Cymraeg ymarferol | Cyfieithu BLEU | Gwrthodiadau |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra masnachol | 90.13 | 89.49 | 90.78 | 74.10 | 0.00% |
| 2 | Claude Opus 5 masnachol | 85.16 | 89.77 | 80.56 | 70.37 | 0.00% |
| 3 | Muse Spark 1.2 pwysau agored | 83.01 | 85.68 | 80.33 | 71.46 | 0.00% |
| 4 | GPT-5.6 Sol masnachol | 82.94 | 84.32 | 81.56 | 71.93 | 0.00% |
| 5 | Claude Opus 4.8 masnachol | 81.56 | 85.02 | 78.11 | 69.29 | 0.05% |
| 6 | Qwen3.8 2.4T-A95B pwysau agored | 81.09 | 86.28 | 75.89 | 60.84 | 0.00% |
| 7 | Qwen3.8 Flash | 79.81 | 84.06 | 75.56 | 58.79 | 0.00% |
| 8 | Claude Fable 5 masnachol | 78.64 | 83.73 | 73.56 | 69.46 | 4.34% |
| 9 | Kimi K3 pwysau agored | 75.12 | 77.92 | 72.33 | 67.62 | 0.00% |
| 10 | GLM-5.3 Flash pwysau agored | 74.38 | 76.21 | 72.56 | 58.41 | 0.00% |
| 11 | GLM-5.3 pwysau agored | 73.38 | 77.31 | 69.44 | 58.05 | 0.00% |
| 12 | Qwen3.8 27B pwysau agored | 70.47 | 79.83 | 61.11 | 46.03 | 0.00% |
Sut y cyfrifir y sgôr gyffredinol: Rhoddir pwysau o 50% i gyfartaledd y naw prawf rhesymu Cymraeg a 50% i gyfartaledd y naw prawf Cymraeg ymarferol. O fewn pob grŵp, mae pob prawf yn cyfrif cymaint â'i gilydd. Mae BLEU y prawf cyfieithu deddfwriaeth yn fesur corpws ar wahân ac nid yw'n rhan o'r sgôr gyffredinol. Cafodd pob model sgôr ar 100% o’r achosion; mae WNLI yn cynnwys 71 o achosion ac ARC-Easy mini 50. Sgoriodd gwrthodiad neu allbwn annilys sero. Rhedwyd GPT-6 Astra, Opus 5, Fable 5, Muse Spark 1.2, GLM-5.3 Flash a GLM-5.3 ag effort=low; hepgorwyd temperature ar gyfer GPT-6 gan nad yw'r API yn ei dderbyn. Sgoriwyd yr ateb terfynol yn unig ar gyfer y modelau rhesymu.
Crynodeb o'r canlyniadau: Sgoriodd GPT-6 Astra 90.13, 4.97 pwynt o flaen Claude Opus 5. Ei sgôr Cymraeg ymarferol o 90.78 a'i BLEU cyfieithu o 74.10 yw'r uchaf yn y tabl; mae ei sgôr rhesymu o 89.49 0.28 pwynt y tu ôl i Opus 5. Cwblhaodd bob un o'r 2,053 o achosion heb wrthodiad, allbwn annilys, ailgais na gwall seilwaith.
Nesaf i'w werthuso: Muse Glimmer 30B. Mae Meta wedi rhyddhau'r model 30B amlieithog dan Apache 2.0. Nid oedd gwasanaeth API Glimmer yng nghatalog byw OpenRouter pan wiriwyd ar 10 Awst 2026, felly caiff y prawf Cymraeg ei gynnal pan fydd gwasanaeth API addas ar gael neu pan fydd y model wedi'i osod ar ein seilwaith lleol.
Y sgorfwrdd estynedig: modelau Cymraeg agored
Mae'r sgorfwrdd estynedig bellach yn cynnwys 23 model a 108,803 o ymatebion. Profwyd Jupiter-N-120B a Chaernarfon 3B Cymraeg Instruct v0.1 ar y set gyhoeddus lawn — 33,657 o achosion yr un — a phrofwyd yr 21 model arall ar samplau o hyd at 100 o achosion o bob set. Defnyddir yr un 19 o setiau craidd a'r un fformiwla ym mhob prawf; defnyddiwyd hedyn hap 1 lle'r oedd y darparwr yn ei gynnal. Adroddir ar y 232 o achosion Archwiliad Iaith CCC ar wahân.
| Safle | Model | Sgôr gyffredinol | Rhesymu Cymraeg | Cymraeg ymarferol | Cyfieithu BLEU | Annilys |
|---|---|---|---|---|---|---|
| 13 | DeepSeek V4.1 Flash pwysau agored | 69.45 | 76.23 | 62.67 | 69.03 | 0.00% |
| 14 | GLM-5.2 pwysau agored | 68.42 | 68.62 | 68.22 | 57.07 | 0.00% |
| 15 | DeepSeek V4-Flash-0731 | 61.63 | 63.14 | 60.11 | 64.95 | 0.00% |
| 16 | Grok 4.20 | 58.13 | 62.38 | 53.89 | 64.20 | 0.00% |
| 17 | Qwen3.5 9B | 55.10 | 57.98 | 52.22 | 37.06 | 0.00% |
| 18 | Jupiter-N-120B | 48.87 | 52.70 | 45.04 | 43.85 | 0.37% |
| 19 | Mwydryn 7B fersiwn 2 | 30.37 | 39.96 | 20.78 | 41.89 | 0.83% |
| 20 | Mistral-7B-Cymraeg-Welsh-v2 | 30.09 | 40.85 | 19.33 | 31.39 | 0.49% |
| 21 | Mwydryn Phi-2 | 26.90 | 36.47 | 17.33 | 9.11 | 2.83% |
| 22 | Caernarfon 3B Cymraeg Instruct v0.1 | 10.83 | 16.80 | 4.86 | 22.00 | 3.52% |
| 23 | Techiaith Llama 3.2 1B Welsh SFT | 9.87 | 17.18 | 2.56 | 1.05 | 34.53% |
Mae allbwn gwag, allbwn sy'n cyrraedd y terfyn tocynnau neu gyfarwyddyd sy’n hirach na ffenestr gyd-destun y model yn annilys ac yn sgorio sero. Mae'r ddau brawf ar y set lawn yn rhoi amcangyfrif mwy sefydlog na'r samplau blaenorol, felly dylid trin cymariaethau manwl â'r samplau fel rhai dangosol. Mae prawf ar yr hen fodel sylfaenol Caernarfon 3B yn yr archif o hyd, ond mae wedi'i dynnu o'r prif dabl gan fod y fersiwn sy’n dilyn cyfarwyddiadau bellach ar gael. Darllen y dadansoddiad a lawrlwytho'r data →
Archwiliad Iaith CCC: canlyniadau beta
Rydym hefyd wedi profi pedwar model ar bymtheg ar 232 o achosion sy'n troi canfyddiadau adroddiad y Coleg Cymraeg am AI, y Gymraeg ac addysg uwch yn brofion ailadroddadwy. Claude Fable 5 a gafodd y cymedr uchaf ar draws y saith is-set; daeth Qwen3.8 Flash yn bedwerydd ar 91.92, GLM-5.3 Flash yn nawfed ar 84.96, GPT-6 Astra yn ddegfed ar 84.26, GLM-5.3 yn unfed ar ddeg ar 82.94, a DeepSeek V4.1 Flash yn ddeuddegfed ar 82.06. Ymhlith yr 17 model blaenllaw, roedd y sgoriau cywiro rhwng 8.59 a 46.87 pwynt canran yn uwch na'r sgoriau esbonio; roedd Jupiter a Chaernarfon yn methu'r dasg gywiro ei hun yn amlach. Gweld y canlyniadau, y dimensiynau a'r data i'w lawrlwytho →
Mesuriadau cyfeirio hŷn BritEval Cymraeg (cymedr, o llm.org.uk): Caernarfon 3B 55.2; Mistral 7B 63.0; Llama 3 8B 62.7. Nid oes modd cymharu'r rhain yn uniongyrchol â sgôr gyffredinol CymraegBench, sy'n cyfuno 18 o setiau. Ar gyfer Jupiter-N, cyhoeddwyd gwelliant o +18 ar ARC-Easy Cymraeg a +5.25 ar MMLU-Lite Cymraeg yn hytrach na chymedr BritEval.
Sgorfwrdd y gynghanedd
Mae protocol Bangor AI yn cyfrannu mesur cyhoeddedig o allu modelau i lunio barddoniaeth gaeth Gymraeg. Mae'n defnyddio 40 o themâu na welwyd wrth hyfforddi, pum cynnig ar bob thema, ac un cyfle yn unig i ateb — heb gylch adborth nac awgrymiadau odli. Caiff pob llinell ei barnu gan beiriant rheolau'r gynghanedd, a storfa'r prosiect yw BangorAI/cynghanedd.
| Model | Dilys, 7 sillaf (crai) | Addas + dilys + newydd | Llinellau unigryw |
|---|---|---|---|
| GPT-5.6 Sol (High/Flex, un cynnig) | 23.0% | 16.0% | 100%* |
| Claude Opus 4.8 (un cynnig) | 20.0%† | 13.5%† | 100% |
| Ein 9B, DPO rownd 3 (y cylch gwella) | 65.0%† | 1.0%† | 42% |
* Dychwelodd Sol 85 o'r 200 o linellau y gofynnwyd amdanynt, sef 42.5% o'r nifer y gofynnwyd amdano; unigryw oedd pob un o'r 85. Cafodd y 115 o linellau na ddychwelwyd sero yn y ddwy golofn ganran. Barnwyd perthnasedd y llinellau glân a dilys gan Claude Opus 4.8, yn annibynnol ar y model a'u cynhyrchodd. † Cyfrifwyd rhesi Opus a'r model 9B gyda fersiwn gynharach o'r gwiriwr ac maent yn aros am ail-sgorio o'r allbwn crai.
Tri phatrwm yn yr un prawf. Ar ôl ail-sgorio, cafodd Sol 23.0% ar ffurf a 16.0% ar y cyfuniad o ffurf ac ystyr, gan gynhyrchu 42.5% o'r llinellau y gofynnwyd amdanynt. Mae'r rhesi hŷn yn awgrymu patrymau gwahanol i Opus a'r model 9B, ond mae angen eu hail-sgorio cyn gwneud honiad cymharol pendant. Mae rheolaeth ar y mesur, gafael ar y thema a'r gallu i gynhyrchu'r nifer o linellau y gofynnir amdanynt yn dri gallu gwahanol.
Modelau rydym yn eu holrhain
Modelau blaenllaw
GPT-6 Astra
Ar frig y tabl â 90.13; Cymraeg ymarferol 90.78 a BLEU 74.10.
Claude Opus 5
Yn ail â 85.16; sgôr rhesymu o 89.77.
GPT-5.6 Sol
Sgôr gyffredinol o 82.94 yn CymraegBench v0.1.
Claude Opus 4.8
Yn bumed â sgôr gyffredinol o 81.56.
Claude Fable 5
Yn wythfed â 78.64; gwrthododd 4.34% o'r ceisiadau.
Grok 4.20
Sgôr gyffredinol o 58.13; roedd yn wannach ar Gymraeg ymarferol.
Modelau agored
Muse Spark 1.2
Yn drydydd ac ar frig y modelau pwysau agored, â sgôr o 83.01.
Qwen3.8 2.4T-A95B
Yn chweched ac yn ail ymhlith y modelau agored, â sgôr o 81.09.
Qwen3.8 Flash
Yn seithfed â 79.81; rhesymu Cymraeg o 84.06 a chymedr CCC o 91.92.
Kimi K3
Yn nawfed yn y tabl, â sgôr o 75.12.
GLM-5.3 Flash
Yn ddegfed â 74.38 mewn prawf cyflawn drwy OpenRouter.
GLM-5.3
Yn unfed ar ddeg â 73.38; rhesymu 77.31 a chymedr CCC o 82.94.
Qwen3.8 27B
Yn ddeuddegfed â 70.47 mewn prawf drwy OpenRouter heb wallau nac allbynnau annilys.
DeepSeek V4.1 Flash
Yn drydydd ar ddeg â 69.45; BLEU 69.03 a chymedr CCC o 82.06.
GLM-5.2
Yn bedwerydd ar ddeg â 68.42, gyda pherfformiad cytbwys ar draws y ddau gategori.
DeepSeek V4-Flash-0731
Yn bymthegfed â 61.63, ond BLEU cyfieithu cryfach o 64.95.
Qwen3.5 9B
Yn ail ar bymtheg; prawf lleol â phwysau BF16 ar RTX 4090 â sgôr o 55.10.
Modelau wedi’u hyfforddi ar y Gymraeg
Jupiter-N-120B
Ôl-hyfforddiant Cymraeg ar Nemotron 120B — dull y gellir ei ailadrodd yn lleol a sail i'n harbrofion.
Caernarfon Cymraeg Instruct
Addasydd LoRA Bangor AI, wedi'i fesur ar bob un o'r 33,657 o achosion.
Mwydryn
Sgôr 26.90 i'r model Phi-2; 30.37 i Mwydryn 7B v2.
Modelau agored Cymraeg →
Canlyniadau a phrotocol y pedwar model ar ddeg agored neu leol.
Y setiau profion →
Catalog o'r gwerthusiadau Cymraeg sydd ar gael, a'r bylchau sydd ar ôl.
