Profi, mesur a meithrin AI Cymraeg
Gwerthusiadau

Gwerthuso AI yn y Gymraeg

Pa mor dda y mae'r peiriannau'n defnyddio'r Gymraeg? Gan nad oes sgorfwrdd cyhoeddus arall, rydym yn cofnodi'r canlyniadau yma.

Pedwar gwerthuswr yn astudio modelau haniaethol mewn arena brofi dryloyw

Dyma'r bwlch a'n sbardunodd i sefydlu'r AIsteddfod: nid oes yr un o'r prif labordai — OpenAI, Anthropic, Meta, xAI, Moonshot, Zhipu na DeepSeek — yn cyhoeddi canlyniadau meincnodi ar gyfer y Gymraeg. Dim ond tua 10–15 o ieithoedd sydd fel arfer yn eu tablau amlieithog, ac nid yw'r Gymraeg yn eu plith. Daw bron pob adnodd meintiol ar gyfer gwerthuso'r Gymraeg o waith academaidd ym Mhrydain: BritLLM/UK-LLM yn UCL, Techiaith ym Mhrifysgol Bangor, a Cardiff NLP. Ceir catalog llawn ar dudalen y setiau profion, a manylion y protocolau a'r dulliau sicrhau ansawdd yn ein methodoleg.

Mae maint y bwlch yn amlwg yn y data hyfforddi. Dim ond tua 0.065% o ddata PaLM oedd yn Gymraeg, a thua 0.00177% yn unig o ddata hyfforddi GPT-3, yn ôl ffigurau Prys a Jones drwy Techiaith. Ychydig iawn o ddeunydd Cymraeg, felly, sydd wrth wraidd y galluoedd a fesurir isod.

CymraegBench v0.1: y deuddeg model blaenllaw

Mae'r brif sampl bellach yn cynnwys 23,708 o ymatebion gan y deuddeg model uchaf ar 19 o setiau profion Cymraeg, ac mae pob gwall seilwaith wedi'i ddatrys. Defnyddiwyd hyd at 100 o achosion o bob set, wedi'u dewis drwy ddull sy'n rhoi'r un achosion bob tro, ag hedyn hap 1 lle'r oedd y darparwr yn ei gynnal, a'r un harnais ar gyfer pob model. Mae'r canlyniadau cyfanredol, sgoriau pob set a'r manylion sydd eu hangen i ailadrodd y profion ar gael yn agored yn BangorAI/cymraeg-bench.

Safle Model Sgôr gyffredinol Rhesymu Cymraeg Cymraeg ymarferol Cyfieithu BLEU Gwrthodiadau
1 GPT-6 Astra masnachol 90.13 89.49 90.78 74.10 0.00%
2 Claude Opus 5 masnachol 85.16 89.77 80.56 70.37 0.00%
3 Muse Spark 1.2 pwysau agored 83.01 85.68 80.33 71.46 0.00%
4 GPT-5.6 Sol masnachol 82.94 84.32 81.56 71.93 0.00%
5 Claude Opus 4.8 masnachol 81.56 85.02 78.11 69.29 0.05%
6 Qwen3.8 2.4T-A95B pwysau agored 81.09 86.28 75.89 60.84 0.00%
7 Qwen3.8 Flash 79.81 84.06 75.56 58.79 0.00%
8 Claude Fable 5 masnachol 78.64 83.73 73.56 69.46 4.34%
9 Kimi K3 pwysau agored 75.12 77.92 72.33 67.62 0.00%
10 GLM-5.3 Flash pwysau agored 74.38 76.21 72.56 58.41 0.00%
11 GLM-5.3 pwysau agored 73.38 77.31 69.44 58.05 0.00%
12 Qwen3.8 27B pwysau agored 70.47 79.83 61.11 46.03 0.00%

Sut y cyfrifir y sgôr gyffredinol: Rhoddir pwysau o 50% i gyfartaledd y naw prawf rhesymu Cymraeg a 50% i gyfartaledd y naw prawf Cymraeg ymarferol. O fewn pob grŵp, mae pob prawf yn cyfrif cymaint â'i gilydd. Mae BLEU y prawf cyfieithu deddfwriaeth yn fesur corpws ar wahân ac nid yw'n rhan o'r sgôr gyffredinol. Cafodd pob model sgôr ar 100% o’r achosion; mae WNLI yn cynnwys 71 o achosion ac ARC-Easy mini 50. Sgoriodd gwrthodiad neu allbwn annilys sero. Rhedwyd GPT-6 Astra, Opus 5, Fable 5, Muse Spark 1.2, GLM-5.3 Flash a GLM-5.3 ag effort=low; hepgorwyd temperature ar gyfer GPT-6 gan nad yw'r API yn ei dderbyn. Sgoriwyd yr ateb terfynol yn unig ar gyfer y modelau rhesymu.

Crynodeb o'r canlyniadau: Sgoriodd GPT-6 Astra 90.13, 4.97 pwynt o flaen Claude Opus 5. Ei sgôr Cymraeg ymarferol o 90.78 a'i BLEU cyfieithu o 74.10 yw'r uchaf yn y tabl; mae ei sgôr rhesymu o 89.49 0.28 pwynt y tu ôl i Opus 5. Cwblhaodd bob un o'r 2,053 o achosion heb wrthodiad, allbwn annilys, ailgais na gwall seilwaith.

Nesaf i'w werthuso: Muse Glimmer 30B. Mae Meta wedi rhyddhau'r model 30B amlieithog dan Apache 2.0. Nid oedd gwasanaeth API Glimmer yng nghatalog byw OpenRouter pan wiriwyd ar 10 Awst 2026, felly caiff y prawf Cymraeg ei gynnal pan fydd gwasanaeth API addas ar gael neu pan fydd y model wedi'i osod ar ein seilwaith lleol.

Y sgorfwrdd estynedig: modelau Cymraeg agored

Mae'r sgorfwrdd estynedig bellach yn cynnwys 23 model a 108,803 o ymatebion. Profwyd Jupiter-N-120B a Chaernarfon 3B Cymraeg Instruct v0.1 ar y set gyhoeddus lawn — 33,657 o achosion yr un — a phrofwyd yr 21 model arall ar samplau o hyd at 100 o achosion o bob set. Defnyddir yr un 19 o setiau craidd a'r un fformiwla ym mhob prawf; defnyddiwyd hedyn hap 1 lle'r oedd y darparwr yn ei gynnal. Adroddir ar y 232 o achosion Archwiliad Iaith CCC ar wahân.

Safle Model Sgôr gyffredinol Rhesymu Cymraeg Cymraeg ymarferol Cyfieithu BLEU Annilys
13DeepSeek V4.1 Flash pwysau agored69.4576.2362.6769.030.00%
14GLM-5.2 pwysau agored68.4268.6268.2257.070.00%
15DeepSeek V4-Flash-073161.6363.1460.1164.950.00%
16Grok 4.2058.1362.3853.8964.200.00%
17Qwen3.5 9B55.1057.9852.2237.060.00%
18Jupiter-N-120B48.8752.7045.0443.850.37%
19Mwydryn 7B fersiwn 230.3739.9620.7841.890.83%
20Mistral-7B-Cymraeg-Welsh-v230.0940.8519.3331.390.49%
21Mwydryn Phi-226.9036.4717.339.112.83%
22Caernarfon 3B Cymraeg Instruct v0.110.8316.804.8622.003.52%
23Techiaith Llama 3.2 1B Welsh SFT9.8717.182.561.0534.53%

Mae allbwn gwag, allbwn sy'n cyrraedd y terfyn tocynnau neu gyfarwyddyd sy’n hirach na ffenestr gyd-destun y model yn annilys ac yn sgorio sero. Mae'r ddau brawf ar y set lawn yn rhoi amcangyfrif mwy sefydlog na'r samplau blaenorol, felly dylid trin cymariaethau manwl â'r samplau fel rhai dangosol. Mae prawf ar yr hen fodel sylfaenol Caernarfon 3B yn yr archif o hyd, ond mae wedi'i dynnu o'r prif dabl gan fod y fersiwn sy’n dilyn cyfarwyddiadau bellach ar gael. Darllen y dadansoddiad a lawrlwytho'r data →

Archwiliad Iaith CCC: canlyniadau beta

Rydym hefyd wedi profi pedwar model ar bymtheg ar 232 o achosion sy'n troi canfyddiadau adroddiad y Coleg Cymraeg am AI, y Gymraeg ac addysg uwch yn brofion ailadroddadwy. Claude Fable 5 a gafodd y cymedr uchaf ar draws y saith is-set; daeth Qwen3.8 Flash yn bedwerydd ar 91.92, GLM-5.3 Flash yn nawfed ar 84.96, GPT-6 Astra yn ddegfed ar 84.26, GLM-5.3 yn unfed ar ddeg ar 82.94, a DeepSeek V4.1 Flash yn ddeuddegfed ar 82.06. Ymhlith yr 17 model blaenllaw, roedd y sgoriau cywiro rhwng 8.59 a 46.87 pwynt canran yn uwch na'r sgoriau esbonio; roedd Jupiter a Chaernarfon yn methu'r dasg gywiro ei hun yn amlach. Gweld y canlyniadau, y dimensiynau a'r data i'w lawrlwytho →

Mesuriadau cyfeirio hŷn BritEval Cymraeg (cymedr, o llm.org.uk): Caernarfon 3B 55.2; Mistral 7B 63.0; Llama 3 8B 62.7. Nid oes modd cymharu'r rhain yn uniongyrchol â sgôr gyffredinol CymraegBench, sy'n cyfuno 18 o setiau. Ar gyfer Jupiter-N, cyhoeddwyd gwelliant o +18 ar ARC-Easy Cymraeg a +5.25 ar MMLU-Lite Cymraeg yn hytrach na chymedr BritEval.

Sgorfwrdd y gynghanedd

Mae protocol Bangor AI yn cyfrannu mesur cyhoeddedig o allu modelau i lunio barddoniaeth gaeth Gymraeg. Mae'n defnyddio 40 o themâu na welwyd wrth hyfforddi, pum cynnig ar bob thema, ac un cyfle yn unig i ateb — heb gylch adborth nac awgrymiadau odli. Caiff pob llinell ei barnu gan beiriant rheolau'r gynghanedd, a storfa'r prosiect yw BangorAI/cynghanedd.

Model Dilys, 7 sillaf (crai) Addas + dilys + newydd Llinellau unigryw
GPT-5.6 Sol (High/Flex, un cynnig) 23.0% 16.0% 100%*
Claude Opus 4.8 (un cynnig) 20.0%† 13.5%† 100%
Ein 9B, DPO rownd 3 (y cylch gwella) 65.0%† 1.0%† 42%

* Dychwelodd Sol 85 o'r 200 o linellau y gofynnwyd amdanynt, sef 42.5% o'r nifer y gofynnwyd amdano; unigryw oedd pob un o'r 85. Cafodd y 115 o linellau na ddychwelwyd sero yn y ddwy golofn ganran. Barnwyd perthnasedd y llinellau glân a dilys gan Claude Opus 4.8, yn annibynnol ar y model a'u cynhyrchodd. † Cyfrifwyd rhesi Opus a'r model 9B gyda fersiwn gynharach o'r gwiriwr ac maent yn aros am ail-sgorio o'r allbwn crai.

Tri phatrwm yn yr un prawf. Ar ôl ail-sgorio, cafodd Sol 23.0% ar ffurf a 16.0% ar y cyfuniad o ffurf ac ystyr, gan gynhyrchu 42.5% o'r llinellau y gofynnwyd amdanynt. Mae'r rhesi hŷn yn awgrymu patrymau gwahanol i Opus a'r model 9B, ond mae angen eu hail-sgorio cyn gwneud honiad cymharol pendant. Mae rheolaeth ar y mesur, gafael ar y thema a'r gallu i gynhyrchu'r nifer o linellau y gofynnir amdanynt yn dri gallu gwahanol.

Modelau rydym yn eu holrhain

Modelau blaenllaw

GPT-6 Astra

Ar frig y tabl â 90.13; Cymraeg ymarferol 90.78 a BLEU 74.10.

Claude Opus 5

Yn ail â 85.16; sgôr rhesymu o 89.77.

GPT-5.6 Sol

Sgôr gyffredinol o 82.94 yn CymraegBench v0.1.

Claude Opus 4.8

Yn bumed â sgôr gyffredinol o 81.56.

Claude Fable 5

Yn wythfed â 78.64; gwrthododd 4.34% o'r ceisiadau.

Grok 4.20

Sgôr gyffredinol o 58.13; roedd yn wannach ar Gymraeg ymarferol.

Modelau agored

Muse Spark 1.2

Yn drydydd ac ar frig y modelau pwysau agored, â sgôr o 83.01.

Qwen3.8 2.4T-A95B

Yn chweched ac yn ail ymhlith y modelau agored, â sgôr o 81.09.

Qwen3.8 Flash

Yn seithfed â 79.81; rhesymu Cymraeg o 84.06 a chymedr CCC o 91.92.

Kimi K3

Yn nawfed yn y tabl, â sgôr o 75.12.

GLM-5.3 Flash

Yn ddegfed â 74.38 mewn prawf cyflawn drwy OpenRouter.

GLM-5.3

Yn unfed ar ddeg â 73.38; rhesymu 77.31 a chymedr CCC o 82.94.

Qwen3.8 27B

Yn ddeuddegfed â 70.47 mewn prawf drwy OpenRouter heb wallau nac allbynnau annilys.

DeepSeek V4.1 Flash

Yn drydydd ar ddeg â 69.45; BLEU 69.03 a chymedr CCC o 82.06.

GLM-5.2

Yn bedwerydd ar ddeg â 68.42, gyda pherfformiad cytbwys ar draws y ddau gategori.

DeepSeek V4-Flash-0731

Yn bymthegfed â 61.63, ond BLEU cyfieithu cryfach o 64.95.

Qwen3.5 9B

Yn ail ar bymtheg; prawf lleol â phwysau BF16 ar RTX 4090 â sgôr o 55.10.

Modelau wedi’u hyfforddi ar y Gymraeg

Jupiter-N-120B

Ôl-hyfforddiant Cymraeg ar Nemotron 120B — dull y gellir ei ailadrodd yn lleol a sail i'n harbrofion.

Caernarfon Cymraeg Instruct

Addasydd LoRA Bangor AI, wedi'i fesur ar bob un o'r 33,657 o achosion.

Mwydryn

Sgôr 26.90 i'r model Phi-2; 30.37 i Mwydryn 7B v2.

Modelau agored Cymraeg →

Canlyniadau a phrotocol y pedwar model ar ddeg agored neu leol.

Y setiau profion →

Catalog o'r gwerthusiadau Cymraeg sydd ar gael, a'r bylchau sydd ar ôl.