25 Medi 2026
Pedwar model newydd, un wers: mae'r manylion yn bwysicach na'r safle
Mae Claude Opus 5.5 yn ail ar CymraegBench, ond mae'r gwahaniaethau rhwng rhesymu, Cymraeg ymarferol, cywiro ac esbonio yn dweud mwy na'r un sgôr.
Ail, ond nid ail ym mhob peth
Rhyddhaodd Anthropic Claude Opus 5.5 ar 22 Medi. Nid oedd canlyniad Cymraeg yn nhablau'r cwmni, felly rhedwyd y model ar yr un protocol CymraegBench â'r modelau eraill ar y safle.
Yn ôl tudalen lawn y gwerthusiad, cafodd Opus 5.5:
- 87.55 yn gyffredinol;
- 89.55 am resymu Cymraeg;
- 85.56 am Gymraeg ymarferol;
- a 72.52 BLEU ar gyfieithu deddfwriaethol.
Cwblhaodd bob un o'r 2,053 o achosion heb wrthod nac anfon allbwn annilys. Mae 2.58 pwynt y tu ôl i GPT-6 Astra yn gyffredinol. Eto i gyd, mae ei sgôr rhesymu 0.06 pwynt yn uwch nag Astra; mantais Astra mewn Cymraeg ymarferol sy'n ei gadw ar y brig.
Mae hynny'n rhybudd rhag troi'r sgorfwrdd yn ras un rhif. O'i gymharu ag Opus 5, mae Opus 5.5 wedi ennill 2.39 pwynt yn gyffredinol a phum pwynt mewn Cymraeg ymarferol, ond mae ei sgôr rhesymu 0.22 pwynt yn is. Mae'r fersiwn newydd yn well ar y protocol cyfan, ond nid ar bob dimensiwn.
Roedd angen cywiro'r sgôr cyn ei chyhoeddi hefyd. Roedd amcangyfrif cynnar o 87.61, ond dangosodd archwiliad o'r sgoriwr deuaidd un ateb a ddaeth i ben gyda'r label anghywir. 87.55 yw'r canlyniad terfynol. Mae'r gwahaniaeth yn fach; mae'r egwyddor yn fawr. Rhaid gallu ailagor y data a gwirio'r mesur ei hun.
Gall cywiro fod yn haws nag esbonio
Ar wahân i CymraegBench, mae'r modelau hefyd yn wynebu Archwiliad Iaith CCC: 232 o achosion sy'n troi canfyddiadau ymchwil am AI a'r Gymraeg mewn addysg uwch yn brofion ailadroddadwy.
Opus 5.5 sydd â'r cymedr uchaf presennol, sef 96.76. Cafodd 100 am gywiro, ond 64.84 am esbonio'r cywiriad. Mae'r un patrwm i'w weld mewn modelau eraill. Cafodd Claude Fable 5.1 96.88 am gywiro a 63.28 am esbonio; 75.00 a 42.19 oedd sgoriau MiMo V2.6 Pro; a 65.63 a 35.94 oedd sgoriau Muse Glimmer 30B.
Gall model, felly, gyrraedd y frawddeg gywir heb roi rheswm dibynadwy drosti. I rywun sydd am loywi testun, gall yr ateb fod yn ddefnyddiol. I ddysgwr neu diwtor sydd am ddeall y rheol, mae'r bwlch yn llawer mwy difrifol. Nid yr un gallu yw golygu ac addysgu.
Tri phroffil gwahanol arall
Mae Claude Fable 5.1 yn nawfed â 80.53. Mae ei sgôr rhesymu, 86.05, yn gryf; 75.00 yw ei sgôr Cymraeg ymarferol. Cwblhaodd 2,052 o'r 2,053 achos, gydag un ateb PIQA yn parhau'n wag ar ôl ail geisio.
Mae MiMo V2.6 Pro yn wythfed â 80.73: dim ond 0.20 pwynt o flaen Fable, ond gyda phroffil gwahanol iawn. Ei sgoriau yw 83.79 am resymu, 77.67 am Gymraeg ymarferol a 61.98 BLEU. Cyhoeddodd Xiaomi bwysau'r teulu MiMo V2.6 yr wythnos hon, ac mae cerdyn swyddogol y model yn nodi trwydded MIT. Mae hynny'n creu cyfle i ymchwilwyr ei redeg a'i addasu ar eu seilwaith eu hunain.
Ond mae nodyn dibynadwyedd pwysig. Cyrhaeddodd 55 o atebion y cap allbwn gwreiddiol; llwyddwyd i adfer 38 ohonynt gyda chap mwy, ond arhosodd 17 yn annilys. Roedd un ar ddeg yn achosion cywiro ac esbonio, pedwar yn ymwneud ag enwau lleoedd, ac roedd y ddau arall yn brofion rhesymu. Mae'r pwysau'n agored; nid yw hynny ynddo'i hun yn gwarantu allbwn dibynadwy.
Mae Muse Glimmer 30B, model â phwysau Apache-2.0, yn bymthegfed â 70.64. Cwblhaodd bob achos, ond mae ei sgôr Cymraeg ymarferol o 63.78 a'i sgôr esbonio o 35.94 yn dangos bwlch clir oddi wrth y modelau blaenllaw.
Nid yw “agored” a “da yn Gymraeg” yn gyfystyron. Mae mynediad agored yn gwneud addasu, archwilio ac ailbrofi'n bosibl. Mae ansawdd yr allbwn yn gwestiwn arall, ac mae angen ei fesur.
Beth mae llais byw yn ei ddatgelu?
Daeth gwers gryfaf y gymhariaeth ryngwladol o Vimarsha, rhagargraff newydd sy'n profi deg system adnabod lleferydd ar draws 22 o ieithoedd India. Mae'r set 100 awr yn cynnwys recordiadau maes ac “yn y gwyllt” gan 5,099 o siaradwyr mewn 356 o ardaloedd, ynghyd ag amrywiadau sillafu dilys wedi'u gwirio gan bobl.
Mae'r systemau gorau ar gyfer ieithoedd India'n symud o tua 10–15% o wallau geiriau ar leferydd rheoledig i 27–34% yn y gwyllt. Roedd cyfartaledd GPT-4o Transcribe yn 89.0% yn y gwyllt yn y prawf hwn. Gwelwyd gwahaniaethau yn ôl demograffeg, arddull siarad a chyflymder hefyd.
Nid canlyniad Cymraeg mo hwn, ac nid yw'n profi y bydd yr un maint o ddirywiad yma. Ond mae'n profi bod ffordd y cesglir prawf yn gallu newid y casgliad yn llwyr. Dylai prawf llais Cymraeg gynnwys acenion lleol, oedrannau, siaradwyr rhugl a dysgwyr, newid rhwng Cymraeg a Saesneg, lleferydd digymell a sain o amodau bob dydd.
Pan fo strwythur yr iaith yn rhan o'r model
Mae Morpho-VITS, rhagargraff ar destun-i-leferydd Kinyarwanda, yn ychwanegu amgodio morffemau a sylw rhwng ffonemau a morffemau. Gostyngodd y gyfradd gwall geiriau o 13.4% i 9.4%, a'r gyfradd gwall nodau o 3.0% i 1.7%. Mewn 2,100 o gymariaethau gan 21 o wrandawyr brodorol, cododd naturioldeb o 3.33 i 3.55.
Mae'r cyfyngiad yr un mor ddiddorol: 19.3% oedd y gyfradd gwall ar forffemau nas gwelwyd o'r blaen, o'i gymharu ag 8.3% ar rai a welwyd. I'r Gymraeg, mae hynny'n awgrymu arbrawf pendant ar dreigladau, terfyniadau a ffurfiau prin. Nid yw'n ddigon dangos bod y model yn gallu ail-greu patrymau sydd eisoes yn y data.
Mae BanglaKontho yn rhoi ail wers. Mae'r set destun-i-leferydd Bangla yn cynnwys 20 awr o lyfr sain, 7,050 o ddarnau, trawsgrifiadau wedi'u gwirio a normaleiddiwr testun ar gyfer rhifau, arian, dyddiadau, atalnodi ac Unicode. Cafodd model a hyfforddwyd ar y set gyfradd gwall geiriau o 9.5% a sgôr naturioldeb o 4.46, o'i gymharu ag 16.0% a 3.16 gyda'r un bensaernïaeth ar gorpws byrrach arall.
Y wers yw nad “mwy o sain” yn unig sydd ei angen. Mae hyd, parth, cysondeb y siaradwr a'r ffordd y caiff testun ei normaleiddio i gyd yn effeithio ar y canlyniad. Gallai corpws Cymraeg hirffurf — gyda phiblinell normaleiddio gyhoeddus — lenwi bwlch gwahanol i gasgliad mawr o glipiau byr.
Mae'r ddau bapur yn rhagargraffiadau. Nid yw'r canlyniadau wedi'u hailadrodd yn annibynnol, ac ni chafwyd hyd i bwynt gwirio cyhoeddus ar gyfer Morpho-VITS. Dylid eu trin fel tystiolaeth addawol i lunio arbrawf, nid fel ateb gorffenedig i'r Gymraeg.
Mesur y Gymraeg y mae pobl yn ei defnyddio
Ni chafwyd model neu set ddata Gymraeg newydd ar y we ehangach yn ystod ffenestr yr adroddiad. Chwiliwyd Nation.Cymru yn benodol. Roedd ei eitem AI amlycaf ar 25 Medi yn ymwneud â busnesau yng Nghymru yn defnyddio AI, nid gallu'r dechnoleg yn Gymraeg. Mae hynny'n stori economaidd ddilys, ond nid yw'n dystiolaeth am yr iaith ac nid yw wedi'i defnyddio i chwyddo wythnos dawel.
Y datblygiad pendant yw'r pedwar gwerthusiad newydd. Maent yn dweud bod y modelau gorau'n gallu gwneud llawer yn Gymraeg; maent hefyd yn dangos lle mae sgôr gyffredinol yn cuddio problem. Gall rhesymu fod yn gryfach na Chymraeg ymarferol. Gall cywiro fod yn gryfach nag esbonio. Gall model agored fod yn hawdd ei archwilio ond yn llai cywir. Gall allbwn edrych yn gyflawn tra bod nifer bach o achosion wedi torri'n llwyr.
Y cam nesaf yw ehangu beth a olygwn wrth “brawf Cymraeg”: nid mwy o gwestiynau glân yn unig, ond llais byw, tafodiaith, newid iaith, enwau lleol, morffoleg, testun hir a'r camgymeriadau sy'n newid ystyr. Mae safle Opus 5.5 yn newyddion. Bydd adeiladu'r prawf sy'n ei herio'n iawn yn bwysicach fyth.
