Archwiliad Iaith CCC beta v0.1
Beth sy'n digwydd pan ofynnwn i'r modelau nid yn unig gywiro'r Gymraeg, ond esbonio'r rheol, dewis y term naturiol, cadw dyfyniad yn union a seilio ateb ar dystiolaeth?
Mae'r archwiliad hwn yn troi'r mathau o fethiant a ddisgrifir yn adroddiad Kara Lewis, Deallusrwydd Artiffisial (AI), y Gymraeg ac Addysg Uwch, yn 232 o achosion â meini prawf sgorio penodol. Lluniwyd pob enghraifft o'r newydd; nid ydynt yn atgynhyrchu deunydd prawf yr adroddiad. Profwyd pedwar model ar bymtheg â'r un harnais a sgorwyr sy'n dilyn rheolau penodol.
Y darlun cyffredinol: Claude Fable 5 sydd â'r cymedr uchaf ar draws y saith is-set, sef 95.60, ac yna GPT-5.6 Sol ar 93.01, Claude Opus 5 ar 92.18 a Qwen3.8 Flash ar 91.92. Sgoriodd GLM-5.3 Flash 84.96, GPT-6 Astra 84.26, GLM-5.3 82.94 a DeepSeek V4.1 Flash 82.06. Mae GPT-6 yn ddegfed yma er ei fod yn gyntaf ar brif sgorfwrdd CymraegBench. Nid sgôr gyffredinol swyddogol mo'r cymedr hwn: mae'r proffil fesul gallu yn bwysicach na'r un rhif.
Y saith is-set
Cyfrifir y golofn «Cymedr» drwy roi'r un pwysau i bob is-set. Fe'i cynigir fel crynodeb cyflym o ganlyniadau'r prawf beta yn unig; ni chaiff ei chymysgu â sgôr gyffredinol CymraegBench. Mae «Achosion wedi’u sgorio» yn dangos nifer yr achosion a gafodd sgôr.
| Model | Cymedr | Cywiro ac esbonio | Priod-ddull | Termau | Crynhoi a dyfynnu | Cyfeiriadau | Cyfarwyddyd Cymraeg | Cyfarwyddyd Saesneg | Achosion wedi’u sgorio |
|---|---|---|---|---|---|---|---|---|---|
| Claude Fable 5 | 95.60 | 94.06 | 100.00 | 93.75 | 92.92 | 88.44 | 100.00 | 100.00 | 232/232* |
| GPT-5.6 Sol | 93.01 | 88.67 | 96.88 | 84.38 | 94.29 | 86.88 | 100.00 | 100.00 | 232/232 |
| Claude Opus 5 | 92.18 | 91.48 | 96.88 | 96.88 | 87.71 | 72.34 | 100.00 | 100.00 | 232/232 |
| Qwen3.8 Flash | 91.92 | 80.94 | 93.75 | 84.38 | 95.18 | 89.22 | 100.00 | 100.00 | 232/232† |
| Claude Opus 4.8 | 90.82 | 81.72 | 93.75 | 81.25 | 96.96 | 88.75 | 96.67 | 96.67 | 232/232 |
| Qwen3.8 2.4T-A95B | 89.99 | 74.38 | 84.38 | 90.63 | 89.91 | 90.63 | 100.00 | 100.00 | 232/232 |
| Muse Spark 1.2 | 87.16 | 84.22 | 100.00 | 96.88 | 90.83 | 87.34 | 73.33 | 77.50 | 232/232 |
| Kimi K3 | 85.67 | 66.13 | 87.50 | 81.25 | 93.12 | 85.00 | 100.00 | 86.67 | 230/232 |
| GLM-5.3 Flash | 84.96 | 66.95 | 78.13 | 93.75 | 90.30 | 75.63 | 93.33 | 96.67 | 232/232 |
| GPT-6 Astra | 84.26 | 92.42 | 96.88 | 96.88 | 92.26 | 89.69 | 60.83 | 60.83 | 232/232 |
| GLM-5.3 | 82.94 | 67.58 | 81.25 | 75.00 | 93.33 | 78.44 | 89.17 | 95.83 | 232/232 |
| DeepSeek V4.1 Flash | 82.06 | 72.73 | 93.75 | 75.00 | 96.25 | 70.00 | 76.67 | 90.00 | 232/232 |
| Grok 4.20 | 78.03 | 72.27 | 75.00 | 62.50 | 99.64 | 78.44 | 83.33 | 75.00 | 232/232 |
| GLM-5.2 | 77.57 | 67.03 | 81.25 | 53.12 | 91.67 | 65.78 | 96.67 | 87.50 | 232/232 |
| DeepSeek V4-Flash-0731 | 75.50 | 73.12 | 74.19 | 75.00 | 94.05 | 55.47 | 72.50 | 84.17 | 231/232 |
| Qwen3.8 27B | 73.53 | 40.94 | 56.25 | 71.88 | 91.19 | 87.81 | 91.67 | 75.00 | 232/232 |
| Qwen3.5 9B | 71.10 | 37.97 | 84.38 | 59.38 | 90.54 | 32.97 | 95.83 | 96.67 | 232/232 |
| Jupiter-N-120B | 67.66 | 17.03 | 75.00 | 46.88 | 90.00 | 59.69 | 89.17 | 95.83 | 232/232 |
| Caernarfon 3B Cymraeg Instruct v0.1 | 10.85 | 0.00 | 3.13 | 12.50 | 5.00 | 22.81 | 17.50 | 15.00 | 232/232 |
* Gwrthododd Fable un achos cyfeiriadau; cafodd y gwrthodiad sgôr o sero yn unol â'r protocol. † Defnyddiodd un ateb Qwen3.8 Flash y terfyn o 131,072 o docynnau heb gynhyrchu ateb terfynol; cafodd sgôr o sero. Daeth dau ateb Kimi ac un ateb DeepSeek V4-Flash-0731 i ben ar derfyn y tocynnau. Yn y prawf ar GLM-5.3, ailadroddwyd 17 o geisiadau a oedd wedi rhoi ateb gwag neu anghyflawn, gan godi'r terfyn i 65,536 o docynnau. Cafwyd ateb cyflawn i bob un wedyn. Cwblhaodd GPT-6 a DeepSeek V4.1 Flash bob achos ar y cynnig cyntaf. Yn y protocol cyhoeddi presennol, cofnodir allbwn sy'n parhau'n wag neu'n anghyflawn ar ôl rhoi cynnig arall arni yn annilys â sgôr sero, nid yn wall seilwaith.
Y berthynas rhwng cywiro ac esbonio
Ymhlith yr 17 model blaenllaw, roedd y sgôr cywiro rhwng 8.59 a 46.87 pwynt canran yn uwch na'r sgôr esbonio; bwlch GPT-6 oedd 41.41 pwynt. Qwen3.8 27B oedd â'r bwlch lleiaf, tra mai sgôr esbonio Muse o 63.28 oedd yr uchaf. Nid oedd yr un patrwm yn berthnasol i Jupiter a Chaernarfon: sgoriodd Jupiter 12.50 am gywiro a 13.28 am esbonio, a sgoriodd Caernarfon sero ar y ddau. Yn eu hachos nhw, mae'r canlyniadau'n dangos bod y dasg gywiro ei hun yn broblem cyn y cam esbonio.
| Model | Cywiriad | Esboniad | Y bwlch |
|---|---|---|---|
| GPT-6 Astra | 96.88 | 55.47 | 41.41 |
| Claude Fable 5 | 96.88 | 62.50 | 34.38 |
| Claude Opus 5 | 96.88 | 60.94 | 35.94 |
| GPT-5.6 Sol | 92.19 | 53.91 | 38.28 |
| Claude Opus 4.8 | 85.94 | 58.59 | 27.35 |
| Qwen3.8 2.4T-A95B | 79.69 | 56.25 | 23.44 |
| Qwen3.8 Flash | 89.06 | 58.59 | 30.47 |
| Muse Spark 1.2 | 85.94 | 63.28 | 22.66 |
| Kimi K3 | 75.81 | 45.97 | 29.84 |
| GLM-5.3 Flash | 71.88 | 43.75 | 28.13 |
| GLM-5.3 | 70.31 | 44.53 | 25.78 |
| DeepSeek V4.1 Flash | 79.69 | 48.44 | 31.25 |
| Grok 4.20 | 78.12 | 49.22 | 28.90 |
| GLM-5.2 | 78.12 | 31.25 | 46.87 |
| DeepSeek V4-Flash-0731 | 76.56 | 47.66 | 28.90 |
| Qwen3.8 27B | 39.06 | 30.47 | 8.59 |
| Qwen3.5 9B | 40.63 | 21.88 | 18.75 |
| Jupiter-N-120B | 12.50 | 13.28 | −0.78 |
| Caernarfon Cymraeg Instruct | 0.00 | 0.00 | 0.00 |
Tri chanfyddiad arall
Mae effaith iaith y cyfarwyddyd yn dibynnu ar y model
Roedd Qwen3.8 27B 16.67 pwynt yn well gyda'r cyfarwyddyd Cymraeg, Kimi 13.33 pwynt yn well, a Grok 8.33 pwynt yn well. Ond roedd DeepSeek V4.1 Flash 13.33 pwynt yn well gyda'r cyfarwyddyd Saesneg, yr hen DeepSeek 11.67 pwynt yn well, a GLM-5.3 6.66 pwynt yn well yn Saesneg. Cafodd GPT-6 60.83 yn y ddwy iaith, tra cafodd Qwen3.8 Flash a Qwen3.8 2.4T-A95B 100 yn y ddwy.
Nid yw osgoi dyfeisio ffynonellau'n gyfystyr â dod o hyd i'r ateb
Sgoriodd y modelau rhwng 96.88 a 100 am beidio â dyfeisio ID ffynhonnell. Eto i gyd, roedd sgôr am gynnwys yr ateb rhwng 39.06 a 71.88. Gall model osgoi dyfeisio cyfeiriadau a dal i fethu ateb yn llawn.
Llwyddodd y modelau i gadw ffeithiau a dyfyniadau
Cadwodd y modelau'r ffeithiau a ddewiswyd yn gywir ar y cyfan: cafodd GPT-6, Qwen3.8 27B, Qwen3.8 Flash, GLM-5.3 Flash a GLM-5.3 100, a Qwen3.8 2.4T-A95B 95.83. Cadwodd y modelau hyn y dyfyniad yn union; Grok oedd gryfaf ar yr is-set gyfan, â 99.64.
Data, dull a statws
Mae'r 232 o achosion, y sgorwyr a'r harnais ar gael yn agored yn BangorAI/cymraeg-bench. Mae'r sgorwyr yn dilyn yr un rheolau penodol bob tro: ni ddefnyddiwyd model arall fel beirniad.
Canlyniadau ymchwil beta yw'r rhain, nid dyfarniad terfynol. Nid yw'r set yn honni cynrychioli pob math o Gymraeg na phob tasg addysg uwch. Bydd yn aros ar statws 0.1.0-beta nes bod o leiaf ddau olygydd Cymraeg annibynnol wedi adolygu pob achos. Cyn cyhoeddi, cywirwyd y sgoriwr dyfyniadau i gydnabod dyfynodau teipograffyddol; ailsgoriwyd 30 ymateb heb wneud unrhyw alwad fodel newydd.
Lawrlwytho'r canlyniadau
- Crynodeb pob model ac is-set (CSV)
- Pob agwedd ar Archwiliad Iaith CCC (CSV)
- Adroddiad cryno (Markdown)
- Adroddiad fesul agwedd (Markdown)
- Mesurau Qwen3.5 9B (CSV)
- Mesurau Qwen3.8 27B (CSV)
- Mesurau Qwen3.8 2.4T-A95B (CSV)
- Mesurau Qwen3.8 Flash (CSV)
- Mesurau GLM-5.3 Flash (CSV)
- Mesurau GLM-5.3 (CSV)
- Mesurau GPT-6 Astra (CSV)
- Mesurau DeepSeek V4.1 Flash (CSV)
Canlyniadau wedi'u cyfuno o'r profion cyhoeddedig · hyd at 10 Medi 2026 · 1,191,766 o docynnau mewnbwn ac 1,210,639 o docynnau allbwn yn y data i'w lawrlwytho.
