21 Awst 2026
Qwen3.8 27B: beth sydd y tu ôl i'r sgôr?
Mae model pwysau agored newydd Qwen yn sgorio 70.47 yn CymraegBench—ond mae'r bwlch rhwng rhesymu Cymraeg a Chymraeg ymarferol yn dangos pam mae angen darllen y proffil cyfan.
Newidiodd prif stori'r wythnos wrth i ganlyniad Cymraeg newydd gyrraedd ar 21 Awst. Mae Qwen3.8 27B yn fodel dwys amlfoddol â 27 biliwn o baramedrau, pwysau Apache 2.0 a ffenestr gyd-destun wreiddiol o 262,144 o docynnau. Mae'n deall testun, delweddau a fideo, ac mae modd rheoli dyfnder ei resymu.
Qwen3.8 27B: 70.47 yn Gymraeg
Ym mhrawf CymraegBench v0.1 AIsteddfod, cafodd Qwen3.8 27B sgôr gyffredinol o 70.47. Mae hynny'n ei roi yn seithfed ar y sgorfwrdd cyfan, rhwng Kimi K3 a GLM-5.2, ac yn ail ymhlith y modelau pwysau agored ar ôl Muse Spark 1.2.
Cwblhaodd bob un o'r 1,821 o achosion heb wrthod cais, cynhyrchu allbwn annilys na dioddef gwall seilwaith. Profwyd y model drwy OpenRouter â thymheredd 0, hedyn hap 1 ac reasoning_effort=low; cadwyd y rhesymu ar wahân a sgoriwyd yr ateb terfynol.
Ond nid 70.47 yw'r stori gyfan. Cafodd y model 79.83 ar resymu Cymraeg, gan gynnwys 96 ar ARC-Easy Cymraeg, 93 ar COPA, 91 ar MGSM Cymraeg, 84.51 ar WNLI Cymraeg ac 83 ar XNLI Cymraeg. Ar Gymraeg ymarferol, 61.11 oedd y sgôr; ar gyfieithu deddfwriaethol, 46.03 BLEU.
Mae'r profion ymarferol yn dangos ble mae angen gwaith: 12 ar enwau lleoedd dwyieithog, 27 ar lefelau CEFR, 28 ar ddosbarthu geiriau anweddus, 47 ar eirfa a 50 ar ramadeg. Mae rhai o'r profion dosbarthu hynny'n unochrog, felly ni ddylid trin un is-sgôr fel dyfarniad terfynol. Ond mae'r patrwm yn glir: mae'r model yn gryf ar resymu wedi'i strwythuro ac yn llawer llai sicr ar wybodaeth a defnydd Cymraeg penodol.
O'i gymharu â Qwen3.5 9B ar yr un harnais, mae'r sgôr gyffredinol 15.37 pwynt yn uwch, y sgôr rhesymu 21.85 pwynt yn uwch, y sgôr ymarferol 8.89 pwynt yn uwch a BLEU 8.97 pwynt yn uwch. Nid arbrawf rheoledig ar effaith maint yw hwn—mae'r model, y feddalwedd cynhyrchu a'r gwasanaeth sy'n rhedeg y model yn wahanol—ond mae'n gynnydd sylweddol a mesuradwy.
Ni ddaethpwyd o hyd i fodel, set ddata, system lleferydd na pheiriant cyfieithu Cymraeg arall yn ystod y cyfnod hwn. Ni ddaeth tystiolaeth dechnegol na chanlyniad ffurfiol newydd i'r amlwg chwaith yn achos Y Dderwen ar ôl ein cofnod ar 7 Awst.
Mae stori gyfredol Newyddion S4C am AI ym myd chwaraeon Cymru yn sôn am ddata athletwyr, ap Pelly ac offeryn carbon Egni.AI yn M-SParc. Mae'n newyddion AI dilys yng Nghymru, ond nid yw'n cyflwyno technoleg iaith Gymraeg, canlyniad dwyieithog na set ddata Gymraeg. Nid yw stori'n dod yn stori AI Cymraeg am ei bod wedi'i chyhoeddi yn Gymraeg.
Mae proffil anghyfartal Qwen3.8 yn gwneud gwaith cymharol yr wythnos hon yn fwy perthnasol, nid yn llai. Mae tri phrosiect mewn ieithoedd eraill yn datgelu sut gall mesur anghywir wneud i gynnydd ddiflannu—neu wneud i fethiant edrych yn well nag ydyw.
Newidiodd y model; arhosodd y sgôr
Mae'r rhagargraff Thinking in a Low-Resource Language, a gyflwynwyd ar 18 Awst, yn ôl-hyfforddi pedwar model cymysgedd-o-arbenigwyr i resymu mewn Groeg. Defnyddiodd yr awduron 118,092 o resi hyfforddi ac fe wnaethant brofi nid cywirdeb yn unig, ond iaith y trywydd rhesymu, nifer y tocynnau, cwblhau'r ateb a chydymffurfio â fformat yr ateb.
Ni newidiodd y brif sgôr cywirdeb rhyw lawer. Mewn un gymhariaeth cafodd y model wedi'i hyfforddi 76.5 yn erbyn 77.2 i'r model sylfaen. Byddai darllen y ddau rif yn unig yn awgrymu na ddigwyddodd fawr ddim.
Ond cyn yr hyfforddiant, ni resymodd y modelau mewn Groeg yn yr un o 1,000 o drywyddau a archwiliwyd. Ar ôl hyfforddi dan oruchwyliaeth, roedd tua 98% o'r trywyddau yn iaith y cwestiwn. Newidiodd rhywbeth sylfaenol i'r defnyddiwr: daeth proses a fu'n gudd mewn iaith arall yn un y gallai siaradwr Groeg ei darllen a'i herio.
Roedd ail ganlyniad yn fwy annifyr. Pan ailadroddodd y tîm yr un hyfforddiant gan newid yr hedyn ar hap yn unig, symudodd y sgôr 7.7 pwynt. Roedd hynny'n fwy na phob gwahaniaeth yr oeddent wedi'i briodoli i ddewis data neu rysáit hyfforddi. Mewn geiriau eraill, roedd rhai o'r “gwelliannau” yn llai na sŵn yr arbrawf.
Y wers i feincnod Cymraeg yw ailadrodd y profion sawl gwaith. A rhaid cofnodi'r hyn sy'n bwysig i'r defnyddiwr: ym mha iaith mae'r model yn cynllunio, pa mor hir yw'r llwybr, a yw'n dilyn y fformat, a faint mae'r ateb yn ei gostio. Gall model gadw'r un canran gywirdeb ond dod yn llawer mwy tryloyw—neu lawer llai.
Pan fo bwlch yn edrych fel gair anghywir
Mae'r ail bapur yn symud o destun i sain. Casglodd tîm Mizo 17.62 awr o leferydd gan 200 o siaradwyr, gan ddefnyddio brawddegau newyddion a dyfarniadau llys a gyfieithwyd a'u gwirio gan siaradwyr brodorol. Mireiniwyd Whisper small, medium a large-v3, ynghyd â model amlieithog SraVaani 1.0.
Cafodd Whisper-large-v3 gyfradd gwallau geiriau arferol o 18.08%. Ond yn Mizo mae pobl weithiau'n uno neu'n gwahanu elfennau morffolegol heb newid dilyniant y llythrennau na'r ystyr i ddarllenydd. Crëodd y tîm fesur ychwanegol sy'n derbyn a ni ac ani fel yr un dilyniant pan fo'r nodau'n cyfateb yn union. O dan y mesur hwn, 7.22% oedd y gyfradd gwall.
Nid yw hynny'n golygu y dylid anwybyddu orgraff safonol, na dewis y rhif is bob tro. Cryfder y papur yw ei fod yn cyhoeddi'r ddau rif ac yna'n archwilio'r allbynnau gyda siaradwr Mizo brodorol.
Daeth chwe math o wall go iawn i'r amlwg: sgript anghywir, enwau pobl a lleoedd, atalfa glotal, rhifau, geiriau Saesneg wedi'u cymysgu â Mizo, a gwahaniaeth sain-orgraff penodol i'r iaith. Cynhyrchodd hyd yn oed y model Whisper gorau bedair brawddeg â darnau mewn sgript Hebraeg. Ni all mesur hael o ffiniau geiriau guddio hynny.
Mae'r gwahaniaeth yn uniongyrchol berthnasol i'r Gymraeg. Dylai prawf lleferydd adrodd y gyfradd gwallau geiriau cyn unrhyw addasu, cyfradd gwallau nodau, a chanlyniad dan bolisi normaleiddio Cymraeg wedi'i gyhoeddi. Wedyn dylai siaradwyr archwilio treigladau, collnodau, sillafiadau tafodieithol, enwau lleoedd, rhifau a newid cod i'r Saesneg. Rhaid gwahaniaethu rhwng gwall y model a dewis rhesymol wrth ysgrifennu—heb guddio'r naill na'r llall.
Mae'r papur yn dweud bod y rhan fwyaf o'r corpws ar gael yn AI-Kosh dan Drwydded Agored ANRF, gyda gweddill y data i ddod, ond bod y modelau eu hunain ar gael i ymchwilwyr ar gais. Rhagargraff gan yr awduron yw hwn, gyda dim ond 192 o frawddegau prawf gan bum siaradwr. Mae'r canlyniad yn addawol; nid yw'n air olaf ar Mizo.
Llai o ddata, mwy i’w ddysgu
Mae TranslatePsy-AfriSLM yn mynd i'r afael â chyfieithu mewn 19 o ieithoedd Affrica. Adeiladodd yr awduron gymysgeddau cyfochrog a synthetig, defnyddio tri amcangyfrifwr ansawdd, a sgorio pob pâr yn yr un cyfeiriad â'r hyfforddiant terfynol.
Roedd y canlyniad mwyaf ymarferol yn ymwneud â gwastraff. Cafodd cymysgedd ffynhonnell agored heb ei hidlo sgôr SSA-COMET o 0.528 ar BOUQuET ar ôl defnyddio 44.93 biliwn o docynnau. Cafodd cymysgedd wedi'i hidlo 0.530 gan ddefnyddio 1.76 biliwn yn unig—96% yn llai. Nid mwy o ddata oedd yr ateb; data mwy defnyddiol oedd yr ateb.
Ar dablau'r awduron, llwyddodd y model lleiaf, 0.8B, i ragori ar bob model cyffredinol, arbenigol ac Affricanaidd a gymharwyd ar FLORES-200, BOUQuET a Smol dan SSA-COMET. Cafodd 0.5944, 0.6223 a 0.4973 yn y drefn honno. Rhagargraff ac arbrofion yr awduron yw'r rhain, nid ail-brawf annibynnol.
Mae un cyfyngiad pwysig iawn. Mae'r papur yn galw'r modelau a'r data yn agored ac yn cysylltu â chasgliad Hugging Face, ond nid oedd y casgliad hwnnw'n agor pan wiriwyd ar 21 Awst. Heb gardiau model, cardiau data a thrwyddedau y gellir eu cyrchu, ni ellir gwirio'r rhyddhad agored eto.
I'r Gymraeg, mae'r dull yn cynnig prawf clir. Cyn tywallt pob cof cyfieithu, is-deitl a phâr synthetig i'r hyfforddiant, dylid sgorio ansawdd yn y cyfeiriad Cymraeg→Saesneg neu Saesneg→Cymraeg sydd ei angen; graddnodi'r hidlydd ar gyfieithiadau Cymraeg gan bobl; dileu deunydd sy'n ailadrodd a chadw'r data prawf allan o'r hyfforddiant; a chadw set ar wahân ar gyfer barn cyfieithwyr.
Diogelwch a'r gost gudd
Mae dau ddatblygiad arall yn troi'r un egwyddor at ddiogelwch a thocynnu.
Mae BabelSteering yn defnyddio 128 o enghreifftiau Saesneg i greu cyfeiriad mewnol sy'n annog model i wrthod ceisiadau niweidiol mewn wyth iaith. Ar Gemma 7B, cododd y gyfradd gwrthod 11 pwynt ar gyfartaledd heb ostyngiad ar GlobalMMLU.
Ond cododd gwrthod ceisiadau diniwed sy'n edrych yn amheus hefyd: o 9% i 21% ar gyfartaledd. Yn Bengali, cododd gwrthod ceisiadau niweidiol 17 pwynt, ond cododd y gor-wrthod 23 pwynt. Felly ni ddylid mesur “diogelwch Cymraeg” drwy gyfrif gwrthodiadau'n unig. Rhaid anfon ceisiadau niweidiol a diniwed mewn Cymraeg naturiol, mewn tafodiaith ac mewn cyd-destun diwylliannol, a mesur y ddau fath o gamgymeriad.
Mae TokEval, papur COLM 2026 gyda chod MIT, yn archwilio'r cam sy'n digwydd cyn i'r model weld geiriau o gwbl. Mae'n mesur effeithlonrwydd gwybodaeth, ffiniau morffemau, cyfanrwydd UTF-8, trin rhifau ac anghydraddoldeb cost rhwng ieithoedd. Yn arbrofion yr awdur, roedd rhai mesurau damcaniaethol yn rhagweld gallu modelu iaith gyda chydberthyniad Spearman hyd at 0.80.
Mae hwn yn offeryn y gellir ei ddefnyddio nawr. Gellid cymharu tocynwyr ar gorpws o Gymraeg go iawn: rhyddiaith, enwau, treigladau, geiriau cyfansawdd, rhifau, cod a brawddegau dwyieithog. Os yw'r un ystyr yn costio dwywaith cymaint o docynnau yn Gymraeg ag yn Saesneg, mae hynny'n fater gallu, pris a mynediad—nid manylyn technegol bach.
Beth ddylai prawf Cymraeg ei ddweud?
Mae'n demtasiwn cywasgu popeth i un rhif. Mae un rhif yn hawdd ei osod ar dabl ac yn hawdd ei rannu. Ond mae'r wythnos hon yn dangos o leiaf saith cwestiwn gwahanol:
- A yw'r ateb yn gywir?
- Ym mha iaith mae'r model yn rhesymu ac yn defnyddio offer?
- A yw'r gwahaniaeth yn fwy na'r amrywiad ar hap rhwng profion hyfforddi?
- Pa wallau ieithyddol go iawn sydd y tu ôl i'r gyfradd gyfartalog?
- Pa newidiadau normaleiddio sy'n gostwng y sgôr, a pha rai sy'n ei chodi?
- A yw hidlo'r data'n eu gwneud yn fwy defnyddiol heb ddileu tafodiaith neu amrywiaeth?
- A yw diogelwch gwell yn achosi i'r model wrthod Cymraeg diniwed?
Nid oes un mesur sy'n ateb y saith. Dylai gwerthusiad Cymraeg credadwy gyhoeddi sawl math o ganlyniad ochr yn ochr: sgôr amrwd a sgôr sy'n ystyried nodweddion yr iaith; categorïau gwall gan siaradwyr; amrywiad rhwng profion; tafodiaith, enwau a newid cod; tocynnau a chost; iaith y trywydd; diogelwch a gor-wrthod; a dolenni at y data, y cod a'r drwydded.
Mae Qwen3.8 27B yn gam gwirioneddol ymlaen: model pwysau agored cymharol gryno sy'n rhesymu'n gryf yn y profion Cymraeg ac yn cwblhau pob achos yn y prawf. Yr un proffil sy'n dangos y gwaith nesaf—enwau lleoedd, lefel iaith, geirfa, gramadeg a chyfieithu—ac felly sy'n gwneud y canlyniad yn ddefnyddiol yn hytrach nag yn drawiadol yn unig.
Nid yw “yn cefnogi Cymraeg” yn ganlyniad. Mae'n honiad. Yr hyn sy'n troi'r honiad yn dystiolaeth yw mesur sy'n deall yr iaith—ac sy'n dangos digon o'i waith i eraill allu gwirio.
