Profi, mesur a meithrin AI Cymraeg
Gwerthusiadau → Archwiliad Iaith CCC

Archwiliad Iaith CCC beta v0.1

Beth sy'n digwydd pan ofynnwn i'r modelau nid yn unig gywiro'r Gymraeg, ond esbonio'r rheol, dewis y term naturiol, cadw dyfyniad yn union a seilio ateb ar dystiolaeth?

Mae'r archwiliad hwn yn troi'r mathau o fethiant a ddisgrifir yn adroddiad Kara Lewis, Deallusrwydd Artiffisial (AI), y Gymraeg ac Addysg Uwch, yn 232 o achosion â meini prawf sgorio penodol. Lluniwyd pob enghraifft o'r newydd; nid ydynt yn atgynhyrchu deunydd prawf yr adroddiad. Profwyd pedwar model ar bymtheg â'r un harnais a sgorwyr sy'n dilyn rheolau penodol.

19model
232achos fesul model
4,408ymateb gan fodelau
0gwall seilwaith heb ei ddatrys

Y darlun cyffredinol: Claude Fable 5 sydd â'r cymedr uchaf ar draws y saith is-set, sef 95.60, ac yna GPT-5.6 Sol ar 93.01, Claude Opus 5 ar 92.18 a Qwen3.8 Flash ar 91.92. Sgoriodd GLM-5.3 Flash 84.96, GPT-6 Astra 84.26, GLM-5.3 82.94 a DeepSeek V4.1 Flash 82.06. Mae GPT-6 yn ddegfed yma er ei fod yn gyntaf ar brif sgorfwrdd CymraegBench. Nid sgôr gyffredinol swyddogol mo'r cymedr hwn: mae'r proffil fesul gallu yn bwysicach na'r un rhif.

Y saith is-set

Cyfrifir y golofn «Cymedr» drwy roi'r un pwysau i bob is-set. Fe'i cynigir fel crynodeb cyflym o ganlyniadau'r prawf beta yn unig; ni chaiff ei chymysgu â sgôr gyffredinol CymraegBench. Mae «Achosion wedi’u sgorio» yn dangos nifer yr achosion a gafodd sgôr.

Model Cymedr Cywiro ac esbonio Priod-ddull Termau Crynhoi a dyfynnu Cyfeiriadau Cyfarwyddyd Cymraeg Cyfarwyddyd Saesneg Achosion wedi’u sgorio
Claude Fable 5 95.6094.06100.0093.7592.9288.44100.00100.00232/232*
GPT-5.6 Sol 93.0188.6796.8884.3894.2986.88100.00100.00232/232
Claude Opus 5 92.1891.4896.8896.8887.7172.34100.00100.00232/232
Qwen3.8 Flash 91.9280.9493.7584.3895.1889.22100.00100.00232/232†
Claude Opus 4.8 90.8281.7293.7581.2596.9688.7596.6796.67232/232
Qwen3.8 2.4T-A95B 89.9974.3884.3890.6389.9190.63100.00100.00232/232
Muse Spark 1.2 87.1684.22100.0096.8890.8387.3473.3377.50232/232
Kimi K3 85.6766.1387.5081.2593.1285.00100.0086.67230/232
GLM-5.3 Flash 84.9666.9578.1393.7590.3075.6393.3396.67232/232
GPT-6 Astra 84.2692.4296.8896.8892.2689.6960.8360.83232/232
GLM-5.3 82.9467.5881.2575.0093.3378.4489.1795.83232/232
DeepSeek V4.1 Flash 82.0672.7393.7575.0096.2570.0076.6790.00232/232
Grok 4.20 78.0372.2775.0062.5099.6478.4483.3375.00232/232
GLM-5.2 77.5767.0381.2553.1291.6765.7896.6787.50232/232
DeepSeek V4-Flash-0731 75.5073.1274.1975.0094.0555.4772.5084.17231/232
Qwen3.8 27B 73.5340.9456.2571.8891.1987.8191.6775.00232/232
Qwen3.5 9B 71.1037.9784.3859.3890.5432.9795.8396.67232/232
Jupiter-N-120B 67.6617.0375.0046.8890.0059.6989.1795.83232/232
Caernarfon 3B Cymraeg Instruct v0.1 10.850.003.1312.505.0022.8117.5015.00232/232

* Gwrthododd Fable un achos cyfeiriadau; cafodd y gwrthodiad sgôr o sero yn unol â'r protocol. † Defnyddiodd un ateb Qwen3.8 Flash y terfyn o 131,072 o docynnau heb gynhyrchu ateb terfynol; cafodd sgôr o sero. Daeth dau ateb Kimi ac un ateb DeepSeek V4-Flash-0731 i ben ar derfyn y tocynnau. Yn y prawf ar GLM-5.3, ailadroddwyd 17 o geisiadau a oedd wedi rhoi ateb gwag neu anghyflawn, gan godi'r terfyn i 65,536 o docynnau. Cafwyd ateb cyflawn i bob un wedyn. Cwblhaodd GPT-6 a DeepSeek V4.1 Flash bob achos ar y cynnig cyntaf. Yn y protocol cyhoeddi presennol, cofnodir allbwn sy'n parhau'n wag neu'n anghyflawn ar ôl rhoi cynnig arall arni yn annilys â sgôr sero, nid yn wall seilwaith.

Y berthynas rhwng cywiro ac esbonio

Ymhlith yr 17 model blaenllaw, roedd y sgôr cywiro rhwng 8.59 a 46.87 pwynt canran yn uwch na'r sgôr esbonio; bwlch GPT-6 oedd 41.41 pwynt. Qwen3.8 27B oedd â'r bwlch lleiaf, tra mai sgôr esbonio Muse o 63.28 oedd yr uchaf. Nid oedd yr un patrwm yn berthnasol i Jupiter a Chaernarfon: sgoriodd Jupiter 12.50 am gywiro a 13.28 am esbonio, a sgoriodd Caernarfon sero ar y ddau. Yn eu hachos nhw, mae'r canlyniadau'n dangos bod y dasg gywiro ei hun yn broblem cyn y cam esbonio.

ModelCywiriadEsboniadY bwlch
GPT-6 Astra96.8855.4741.41
Claude Fable 596.8862.5034.38
Claude Opus 596.8860.9435.94
GPT-5.6 Sol92.1953.9138.28
Claude Opus 4.885.9458.5927.35
Qwen3.8 2.4T-A95B79.6956.2523.44
Qwen3.8 Flash89.0658.5930.47
Muse Spark 1.285.9463.2822.66
Kimi K375.8145.9729.84
GLM-5.3 Flash71.8843.7528.13
GLM-5.370.3144.5325.78
DeepSeek V4.1 Flash79.6948.4431.25
Grok 4.2078.1249.2228.90
GLM-5.278.1231.2546.87
DeepSeek V4-Flash-073176.5647.6628.90
Qwen3.8 27B39.0630.478.59
Qwen3.5 9B40.6321.8818.75
Jupiter-N-120B12.5013.28−0.78
Caernarfon Cymraeg Instruct0.000.000.00

Tri chanfyddiad arall

Mae effaith iaith y cyfarwyddyd yn dibynnu ar y model

Roedd Qwen3.8 27B 16.67 pwynt yn well gyda'r cyfarwyddyd Cymraeg, Kimi 13.33 pwynt yn well, a Grok 8.33 pwynt yn well. Ond roedd DeepSeek V4.1 Flash 13.33 pwynt yn well gyda'r cyfarwyddyd Saesneg, yr hen DeepSeek 11.67 pwynt yn well, a GLM-5.3 6.66 pwynt yn well yn Saesneg. Cafodd GPT-6 60.83 yn y ddwy iaith, tra cafodd Qwen3.8 Flash a Qwen3.8 2.4T-A95B 100 yn y ddwy.

Nid yw osgoi dyfeisio ffynonellau'n gyfystyr â dod o hyd i'r ateb

Sgoriodd y modelau rhwng 96.88 a 100 am beidio â dyfeisio ID ffynhonnell. Eto i gyd, roedd sgôr am gynnwys yr ateb rhwng 39.06 a 71.88. Gall model osgoi dyfeisio cyfeiriadau a dal i fethu ateb yn llawn.

Llwyddodd y modelau i gadw ffeithiau a dyfyniadau

Cadwodd y modelau'r ffeithiau a ddewiswyd yn gywir ar y cyfan: cafodd GPT-6, Qwen3.8 27B, Qwen3.8 Flash, GLM-5.3 Flash a GLM-5.3 100, a Qwen3.8 2.4T-A95B 95.83. Cadwodd y modelau hyn y dyfyniad yn union; Grok oedd gryfaf ar yr is-set gyfan, â 99.64.

Data, dull a statws

Mae'r 232 o achosion, y sgorwyr a'r harnais ar gael yn agored yn BangorAI/cymraeg-bench. Mae'r sgorwyr yn dilyn yr un rheolau penodol bob tro: ni ddefnyddiwyd model arall fel beirniad.

Canlyniadau ymchwil beta yw'r rhain, nid dyfarniad terfynol. Nid yw'r set yn honni cynrychioli pob math o Gymraeg na phob tasg addysg uwch. Bydd yn aros ar statws 0.1.0-beta nes bod o leiaf ddau olygydd Cymraeg annibynnol wedi adolygu pob achos. Cyn cyhoeddi, cywirwyd y sgoriwr dyfyniadau i gydnabod dyfynodau teipograffyddol; ailsgoriwyd 30 ymateb heb wneud unrhyw alwad fodel newydd.

Lawrlwytho'r canlyniadau

Canlyniadau wedi'u cyfuno o'r profion cyhoeddedig · hyd at 10 Medi 2026 · 1,191,766 o docynnau mewnbwn ac 1,210,639 o docynnau allbwn yn y data i'w lawrlwytho.