Gwerthuso AI yn y Gymraeg
Pa mor dda y mae'r peiriannau'n defnyddio'r Gymraeg? Gan nad oes sgorfwrdd cyhoeddus arall, rydym yn cofnodi'r canlyniadau yma.

Dyma'r bwlch a'n sbardunodd i sefydlu'r AIsteddfod: nid oes yr un o'r prif labordai — OpenAI, Anthropic, Meta, xAI, Moonshot, Zhipu na DeepSeek — yn cyhoeddi canlyniadau meincnodi ar gyfer y Gymraeg. Dim ond tua 10–15 o ieithoedd sydd fel arfer yn eu tablau amlieithog, ac nid yw'r Gymraeg yn eu plith. Daw bron pob adnodd meintiol ar gyfer gwerthuso'r Gymraeg o waith academaidd ym Mhrydain: BritLLM/UK-LLM yn UCL, Techiaith ym Mhrifysgol Bangor, a Cardiff NLP. Ceir catalog llawn ar dudalen y setiau profion, a manylion y protocolau a'r dulliau sicrhau ansawdd yn ein methodoleg.
Mae maint y bwlch yn amlwg yn y data hyfforddi. Dim ond tua 0.065% o ddata PaLM oedd yn Gymraeg, a thua 0.00177% yn unig o ddata hyfforddi GPT-3, yn ôl ffigurau Prys a Jones drwy Techiaith. Ychydig iawn o ddeunydd Cymraeg, felly, sydd wrth wraidd y galluoedd a fesurir isod.
CymraegBench v0.1: yr un model ar bymtheg blaenllaw
Mae'r brif sampl bellach yn cynnwys 31,920 o ymatebion gan yr un model ar bymtheg uchaf ar 19 o setiau profion Cymraeg, ac mae pob gwall seilwaith wedi'i ddatrys. Defnyddiwyd hyd at 100 o achosion o bob set, wedi'u dewis drwy ddull sy'n rhoi'r un achosion bob tro, ag hedyn hap 1 lle'r oedd y darparwr yn ei gynnal, a'r un harnais ar gyfer pob model. Mae'r canlyniadau cyfanredol, sgoriau pob set a'r manylion sydd eu hangen i ailadrodd y profion ar gael yn agored yn BangorAI/cymraeg-bench.
| Safle | Model | Sgôr gyffredinol | Rhesymu Cymraeg | Cymraeg ymarferol | Cyfieithu BLEU | Gwrthodiadau |
|---|---|---|---|---|---|---|
| 1 | GPT-6 Astra masnachol | 90.13 | 89.49 | 90.78 | 74.10 | 0.00% |
| 2 | Claude Opus 5.5 masnachol | 87.55 | 89.55 | 85.56 | 72.52 | 0.00% |
| 3 | Claude Opus 5 masnachol | 85.16 | 89.77 | 80.56 | 70.37 | 0.00% |
| 4 | Muse Spark 1.2 pwysau agored | 83.01 | 85.68 | 80.33 | 71.46 | 0.00% |
| 5 | GPT-5.6 Sol masnachol | 82.94 | 84.32 | 81.56 | 71.93 | 0.00% |
| 6 | Claude Opus 4.8 masnachol | 81.56 | 85.02 | 78.11 | 69.29 | 0.05% |
| 7 | Qwen3.8 2.4T-A95B pwysau agored | 81.09 | 86.28 | 75.89 | 60.84 | 0.00% |
| 8 | MiMo V2.6 Pro pwysau agored | 80.73 | 83.79 | 77.67 | 61.98 | 0.00% |
| 9 | Claude Fable 5.1 masnachol | 80.53 | 86.05 | 75.00 | 71.07 | 0.00% |
| 10 | Qwen3.8 Flash pwysau agored | 79.81 | 84.06 | 75.56 | 58.79 | 0.00% |
| 11 | Claude Fable 5 masnachol | 78.64 | 83.73 | 73.56 | 69.46 | 4.34% |
| 12 | Kimi K3 pwysau agored | 75.12 | 77.92 | 72.33 | 67.62 | 0.00% |
| 13 | GLM-5.3 Flash pwysau agored | 74.38 | 76.21 | 72.56 | 58.41 | 0.00% |
| 14 | GLM-5.3 pwysau agored | 73.38 | 77.31 | 69.44 | 58.05 | 0.00% |
| 15 | Muse Glimmer 30B pwysau agored | 70.64 | 77.50 | 63.78 | 60.71 | 0.00% |
| 16 | Qwen3.8 27B pwysau agored | 70.47 | 79.83 | 61.11 | 46.03 | 0.00% |
Sut y cyfrifir y sgôr gyffredinol: Rhoddir pwysau o 50% i gyfartaledd y naw prawf rhesymu Cymraeg a 50% i gyfartaledd y naw prawf Cymraeg ymarferol. O fewn pob grŵp, mae pob prawf yn cyfrif cymaint â'i gilydd. Mae BLEU y prawf cyfieithu deddfwriaeth yn fesur corpws ar wahân ac nid yw'n rhan o'r sgôr gyffredinol. Cafodd pob model sgôr ar 100% o’r achosion; mae WNLI yn cynnwys 71 o achosion ac ARC-Easy mini 50. Sgoriodd gwrthodiad neu allbwn annilys sero. Rhedwyd GPT-6 Astra, Opus 5.5, Opus 5, Fable 5.1, Fable 5, Muse Spark 1.2, Muse Glimmer 30B, GLM-5.3 Flash a GLM-5.3 ag effort=low; hepgorwyd temperature ar gyfer GPT-6 gan nad yw'r API yn ei dderbyn. Ar y ddwy set ddeuaidd, derbynnir label Y/N clir ar ddechrau ateb hyd yn oed os oes esboniad ar ei ôl. Sgoriwyd yr ateb terfynol yn unig ar gyfer y modelau rhesymu.
Crynodeb o'r canlyniadau: Sgoriodd GPT-6 Astra 90.13, 2.58 pwynt o flaen Claude Opus 5.5 ar 87.55. Cwblhaodd Opus 5.5 bob un o'r 2,053 o achosion heb wrthodiad nac allbwn annilys. Mae ei sgôr rhesymu o 89.55 yn 0.06 pwynt yn uwch na GPT-6, ond GPT-6 sydd ar y blaen mewn Cymraeg ymarferol.
Y sgorfwrdd estynedig: modelau Cymraeg agored
Mae'r sgorfwrdd estynedig bellach yn cynnwys 27 model a 117,015 o ymatebion. Profwyd Jupiter-N-120B a Chaernarfon 3B Cymraeg Instruct v0.1 ar y set gyhoeddus lawn — 33,657 o achosion yr un — a phrofwyd y 25 model arall ar samplau o hyd at 100 o achosion o bob set. Defnyddir yr un 19 o setiau craidd a'r un fformiwla ym mhob prawf; defnyddiwyd hedyn hap 1 lle'r oedd y darparwr yn ei gynnal. Adroddir ar y 232 o achosion Archwiliad Iaith CCC ar wahân.
| Safle | Model | Sgôr gyffredinol | Rhesymu Cymraeg | Cymraeg ymarferol | Cyfieithu BLEU | Annilys |
|---|---|---|---|---|---|---|
| 17 | DeepSeek V4.1 Flash pwysau agored | 69.45 | 76.23 | 62.67 | 69.03 | 0.00% |
| 18 | GLM-5.2 pwysau agored | 68.42 | 68.62 | 68.22 | 57.07 | 0.00% |
| 19 | DeepSeek V4-Flash-0731 | 61.63 | 63.14 | 60.11 | 64.95 | 0.00% |
| 20 | Grok 4.20 | 58.13 | 62.38 | 53.89 | 64.20 | 0.00% |
| 21 | Qwen3.5 9B | 55.10 | 57.98 | 52.22 | 37.06 | 0.00% |
| 22 | Jupiter-N-120B | 48.87 | 52.70 | 45.04 | 43.85 | 0.37% |
| 23 | Mwydryn 7B fersiwn 2 | 30.37 | 39.96 | 20.78 | 41.89 | 0.83% |
| 24 | Mistral-7B-Cymraeg-Welsh-v2 | 30.09 | 40.85 | 19.33 | 31.39 | 0.49% |
| 25 | Mwydryn Phi-2 | 26.90 | 36.47 | 17.33 | 9.11 | 2.83% |
| 26 | Caernarfon 3B Cymraeg Instruct v0.1 | 10.83 | 16.80 | 4.86 | 22.00 | 3.52% |
| 27 | Techiaith Llama 3.2 1B Welsh SFT | 9.87 | 17.18 | 2.56 | 1.05 | 34.53% |
Mae allbwn gwag, allbwn sy'n cyrraedd y terfyn tocynnau neu gyfarwyddyd sy’n hirach na ffenestr gyd-destun y model yn annilys ac yn sgorio sero. Mae'r ddau brawf ar y set lawn yn rhoi amcangyfrif mwy sefydlog na'r samplau blaenorol, felly dylid trin cymariaethau manwl â'r samplau fel rhai dangosol. Mae prawf ar yr hen fodel sylfaenol Caernarfon 3B yn yr archif o hyd, ond mae wedi'i dynnu o'r prif dabl gan fod y fersiwn sy’n dilyn cyfarwyddiadau bellach ar gael. Darllen y dadansoddiad a lawrlwytho'r data →
Archwiliad Iaith CCC: canlyniadau beta
Rydym hefyd wedi profi 23 model ar 232 o achosion sy'n troi canfyddiadau adroddiad y Coleg Cymraeg am AI, y Gymraeg ac addysg uwch yn brofion ailadroddadwy. Claude Opus 5.5 a gafodd y cymedr uchaf ar draws y saith is-set, sef 96.76; Claude Fable 5 sydd nesaf ar 95.60, ac yna Claude Fable 5.1 ar 93.88. Mae'r proffil fesul gallu, nid yr un cymedr, yn parhau'n brif ganlyniad yr archwiliad. Gweld y canlyniadau, y dimensiynau a'r data i'w lawrlwytho →
Mesuriadau cyfeirio hŷn BritEval Cymraeg (cymedr, o llm.org.uk): Caernarfon 3B 55.2; Mistral 7B 63.0; Llama 3 8B 62.7. Nid oes modd cymharu'r rhain yn uniongyrchol â sgôr gyffredinol CymraegBench, sy'n cyfuno 18 o setiau. Ar gyfer Jupiter-N, cyhoeddwyd gwelliant o +18 ar ARC-Easy Cymraeg a +5.25 ar MMLU-Lite Cymraeg yn hytrach na chymedr BritEval.
Sgorfwrdd y gynghanedd
Mae protocol Bangor AI yn cyfrannu mesur cyhoeddedig o allu modelau i lunio barddoniaeth gaeth Gymraeg. Mae'n defnyddio 40 o themâu na welwyd wrth hyfforddi, pum cynnig ar bob thema, ac un cyfle yn unig i ateb — heb gylch adborth nac awgrymiadau odli. Caiff pob llinell ei barnu gan beiriant rheolau'r gynghanedd, a storfa'r prosiect yw BangorAI/cynghanedd.
| Model | Dilys, 7 sillaf (crai) | Addas + dilys + newydd | Llinellau unigryw |
|---|---|---|---|
| GPT-5.6 Sol (High/Flex, un cynnig) | 23.0% | 16.0% | 100%* |
| Claude Opus 4.8 (un cynnig) | 20.0%† | 13.5%† | 100% |
| Ein 9B, DPO rownd 3 (y cylch gwella) | 65.0%† | 1.0%† | 42% |
* Dychwelodd Sol 85 o'r 200 o linellau y gofynnwyd amdanynt, sef 42.5% o'r nifer y gofynnwyd amdano; unigryw oedd pob un o'r 85. Cafodd y 115 o linellau na ddychwelwyd sero yn y ddwy golofn ganran. Barnwyd perthnasedd y llinellau glân a dilys gan Claude Opus 4.8, yn annibynnol ar y model a'u cynhyrchodd. † Cyfrifwyd rhesi Opus a'r model 9B gyda fersiwn gynharach o'r gwiriwr ac maent yn aros am ail-sgorio o'r allbwn crai.
Tri phatrwm yn yr un prawf. Ar ôl ail-sgorio, cafodd Sol 23.0% ar ffurf a 16.0% ar y cyfuniad o ffurf ac ystyr, gan gynhyrchu 42.5% o'r llinellau y gofynnwyd amdanynt. Mae'r rhesi hŷn yn awgrymu patrymau gwahanol i Opus a'r model 9B, ond mae angen eu hail-sgorio cyn gwneud honiad cymharol pendant. Mae rheolaeth ar y mesur, gafael ar y thema a'r gallu i gynhyrchu'r nifer o linellau y gofynnir amdanynt yn dri gallu gwahanol.
Modelau rydym yn eu holrhain
Modelau blaenllaw
GPT-6 Astra
Ar frig y tabl â 90.13; Cymraeg ymarferol 90.78 a BLEU 74.10.
Claude Opus 5.5
Yn ail â 87.55; sgôr rhesymu o 89.55.
Claude Opus 5
Yn drydydd â 85.16; sgôr rhesymu o 89.77.
GPT-5.6 Sol
Sgôr gyffredinol o 82.94 yn CymraegBench v0.1.
Claude Opus 4.8
Yn chweched â sgôr gyffredinol o 81.56.
Claude Fable 5
Yn unfed ar ddeg â 78.64; gwrthododd 4.34% o'r ceisiadau.
Claude Fable 5.1
Yn nawfed â 80.53; sgôr rhesymu o 86.05 a BLEU o 71.07.
Grok 4.20
Sgôr gyffredinol o 58.13; roedd yn wannach ar Gymraeg ymarferol.
Modelau agored
Muse Spark 1.2
Yn bedwerydd ac ar frig y modelau pwysau agored, â sgôr o 83.01.
Qwen3.8 2.4T-A95B
Yn seithfed ac yn ail ymhlith y modelau agored, â sgôr o 81.09.
MiMo V2.6 Pro
Yn wythfed â 80.73; sgôr rhesymu o 83.79 a 17 allbwn annilys.
Muse Glimmer 30B
Yn bymthegfed â 70.64; cwblhaodd bob achos am $0.62.
Qwen3.8 Flash
Yn ddegfed â 79.81; rhesymu Cymraeg o 84.06 a chymedr CCC o 91.92.
Kimi K3
Yn ddeuddegfed yn y tabl, â sgôr o 75.12.
GLM-5.3 Flash
Yn drydydd ar ddeg â 74.38 mewn prawf cyflawn drwy OpenRouter.
GLM-5.3
Yn bedwerydd ar ddeg â 73.38; rhesymu 77.31 a chymedr CCC o 82.94.
Qwen3.8 27B
Yn unfed ar bymtheg â 70.47 mewn prawf drwy OpenRouter heb wallau nac allbynnau annilys.
DeepSeek V4.1 Flash
Yn ail ar bymtheg â 69.45; BLEU 69.03 a chymedr CCC o 82.06.
GLM-5.2
Yn ddeunawfed â 68.42, gyda pherfformiad cytbwys ar draws y ddau gategori.
DeepSeek V4-Flash-0731
Yn bedwerydd ar bymtheg â 61.63, ond BLEU cyfieithu cryfach o 64.95.
Qwen3.5 9B
Yn unfed ar hugain; prawf lleol â phwysau BF16 ar RTX 4090 â sgôr o 55.10.
Modelau wedi’u hyfforddi ar y Gymraeg
Jupiter-N-120B
Ôl-hyfforddiant Cymraeg ar Nemotron 120B — dull y gellir ei ailadrodd yn lleol a sail i'n harbrofion.
Caernarfon Cymraeg Instruct
Addasydd LoRA Bangor AI, wedi'i fesur ar bob un o'r 33,657 o achosion.
Mwydryn
Sgôr 26.90 i'r model Phi-2; 30.37 i Mwydryn 7B v2.
Modelau agored Cymraeg →
Canlyniadau a phrotocol y pedwar model ar ddeg agored neu leol.
Y setiau profion →
Catalog o'r gwerthusiadau Cymraeg sydd ar gael, a'r bylchau sydd ar ôl.
