Profi, mesur a meithrin AI Cymraeg
Newyddion → Wythnos 40

2 Hydref 2026

O egwyddor i brawf: adeiladu'r Gymraeg i mewn i AI

Mae pecyn UNESCO a phrawf newydd o allu gramadegol modelau yn dangos pam mae angen adeiladu'r Gymraeg i mewn o'r dechrau a phrofi pob pwynt gwirio.

Dwylo o wahanol genedlaethau yn adeiladu system ddigidol amlieithog ar hyd llwybr drwy dirwedd Gymreig
Dylai'r Gymraeg fod yn rhan o'r syniad, y fanyleb a'r gwasanaeth—nid yn haen a ychwanegir ar y diwedd.

Y Gymraeg fel rhan o'r fanyleb

Cyhoeddodd UNESCO becyn newydd, Practical Toolkit for Supporting Multilingual Digital Services, ar 29 Medi. Mae'n addasu profiad Llywodraeth Cymru o gynllunio technoleg ddwyieithog er mwyn i lywodraethau, sefydliadau a thimau digidol mewn gwledydd eraill allu ei ddefnyddio.

Prif egwyddor cyhoeddiad UNESCO yw na ddylid ychwanegu iaith ar ddiwedd prosiect. Dylai gofynion amlieithog fod yn rhan o'r syniad, y fanyleb, y rhyngwyneb, y cynnwys a'r swyddogaeth o'r dechrau. Dywedodd Llywodraeth Cymru ar 30 Medi fod profiad y Gymraeg yn cael ei gyflwyno fel enghraifft ryngwladol, yn enwedig i ieithoedd brodorol ac ieithoedd llai eu hadnoddau.

Nid model AI newydd mo hwn. Nid oes set ddata, pwysau na sgôr Gymraeg newydd yn y pecyn. Ei arwyddocâd yw'r cam cyn dewis model: pwy sy'n ysgrifennu'r gofynion, pa fath o fewnbwn Cymraeg sy'n rhaid i'r gwasanaeth ei dderbyn, sut y profir cydraddoldeb, a beth sy'n digwydd pan fydd yr iaith yn newid o fewn yr un sgwrs.

Os yw gwasanaeth AI yn trin y Gymraeg fel haen gyfieithu ar y diwedd, gall methiant ymddangos ym mhobman arall: adnabod llais, enwau lleol, newid rhwng Cymraeg a Saesneg, negeseuon gwall a'r llwybr at gymorth dynol. Mae'r pecyn yn gwneud yr egwyddor yn glir. Mae ymchwil newydd yr wythnos yn dangos pa mor fanwl y mae angen profi'r canlyniad.

Yr un teulu, canlyniad gwahanol

Cyflwynwyd astudiaeth newydd ar arXiv ar 30 Medi. Mae'n cymharu modelau sylfaenol â'r fersiynau sydd wedi cael ôl-hyfforddiant—y cam sy'n ceisio eu gwneud yn well am ddilyn cyfarwyddiadau a sgwrsio—ar MultiBLiMP, prawf o barau brawddegau ar draws 101 o ieithoedd.

Mae 1,120 o barau Cymraeg yn nhablau'r papur. Mae'r canlyniadau'n amrywio'n fawr:

Ar gyfartaledd ar draws yr ieithoedd a'r modelau mwyaf, mae'r papur yn gweld colled ar ôl ôl-hyfforddi, gyda'r gost fwyaf i ieithoedd llai eu hadnoddau. Ond mae'r Gymraeg yn dangos pam na ddylid troi'r cyfartaledd hwnnw'n rheol syml: mae'r un cam yn costio 12.8 pwynt i un model ac yn ychwanegu 16.7 at un arall.

Nid yw “Qwen”, “Gemma” neu “fodel amlieithog” yn ddigon o fanylion, felly. Rhaid enwi'r union bwynt gwirio, y dull profi a'r ffordd y cafodd y cwestiwn ei ofyn. Yn yr astudiaeth hon, roedd ysgogiad brodorol—“Dyma frawddeg yn y Gymraeg”—hefyd yn adfer rhywfaint o allu yr oedd dull uniongyrchol yn ei golli.

Mae cod y gwerthusiad ar gael, ond rhagargraff yw'r papur yma. Mae'r dudalen arXiv yn nodi “EMNLP Main 2026”; ni chadarnhawyd cofnod trafodion ar wahân yn ystod yr adolygiad hwn. Roedd copi OpenReview eisoes yn gyhoeddus cyn yr wythnos hon, felly'r hyn sy'n newydd yw'r fersiwn arXiv, nid ymddangosiad cyntaf yr ymchwil.

Peidio â chredu un rhediad

Mae MGhana-ST, set a phrawf cyfieithu lleferydd ar gyfer Ga, Twi, Ewe a Fante, yn ychwanegu rhybudd arall. Defnyddiodd yr ymchwilwyr 16.1 awr o sain ac addasodd 37 o siaradwyr brodorol y cyfieithiadau Saesneg yn uniongyrchol o'r sain.

Mewn dadansoddiad cynharach o un rhediad, roedd cyfuno'r ieithoedd wrth hyfforddi'n ymddangos fel petai'n helpu tair o'r pedair. Ar ôl ailadrodd y profion gyda thri hedyn ar hap, diflannodd y stori honno. Roedd cynnydd Ga o 0.51 BLEU a Twi o 0.06 o fewn amrywiad y rhediadau unigol; collodd Ewe 6.99 a Fante 5.11.

Mae hynny'n wers uniongyrchol i arbrofion Cymraeg. Os yw'r cynnydd yn llai na'r amrywiad rhwng rhediadau, nid yw un rhif cadarnhaol yn dystiolaeth ddigonol. Dylid cyhoeddi cymedr, amrywiad a manylion yr hadau, nid y rhediad gorau yn unig. Mae anodiadau MGhana-ST ar gael dan CC BY 4.0, er bod sain Ewe yn cadw cyfyngiadau anfasnachol ac ar ddeilliadau o'i ffynhonnell wreiddiol.

Profi llais, nid label iaith yn unig

Mae prawf newydd o 11 system adnabod lleferydd ar draws Basgeg, Catalaneg, Galiseg, Portiwgaleg a Sbaeneg yn dangos beth y gall sgôr gyfartalog ei guddio. Ar Fasgeg, roedd y gyfradd gwall geiriau yn amrywio o 7.4% gyda Scribe v2 i dros 100% mewn sawl system nad oedd yn cefnogi'r iaith yn benodol. Roedd Whisper-large-v3 ar 51.9%, tra oedd seamless-m4t-v2-large ar 13.0%.

Roedd gwahaniaeth rhwng siaradwyr gwrywaidd a benywaidd yn y rhan fwyaf o'r systemau hefyd; 17.1 pwynt oedd y bwlch cyfunol mwyaf. Mae'r awduron yn rhybuddio bod y setiau'n anghytbwys ac yn dod o barthau gwahanol, felly nid yw'r rhifau'n brawf o ymddygiad pob gwasanaeth yn y byd go iawn. Maent yn dangos, fodd bynnag, nad yw'r label “amlieithog” yn gwarantu perfformiad cyfartal.

I'r Gymraeg, byddai prawf llais defnyddiol yn torri'r canlyniad yn ôl tafodiaith, rhyw, oedran, rhuglder, parth, ansawdd sain a newid iaith. Byddai hefyd yn cofnodi cyflymder a thrwydded y model. Ni all un WER ar gyfartaledd ateb y cwestiynau hynny.

Grŵp amrywiol o siaradwyr yn anfon rhubanau llais drwy sawl pwynt gwirio a llwybr mesur gwahanol
Nid yw un sgôr yn ddigon: mae angen ailadrodd profion ac edrych ar wahanol siaradwyr, parthau a phwyntiau gwirio.

Dewis cymar drwy dystiolaeth

Mae RunyaNER yn cyflwyno'r prawf enwau endid cyntaf sydd ar gael yn gyhoeddus ar gyfer Runyankore: 30,007 o frawddegau, 237,076 o docynnau a 5,511 o enwau pobl, lleoedd, sefydliadau a dyddiadau. Gwiriwyd pob label gan un siaradwr iaith gyntaf.

Y cwestiwn oedd pa iaith arall sydd orau i helpu pan fo data Runyankore yn brin. Yn y prawf trosglwyddo sero-saethiad, roedd pedair iaith a ddewiswyd drwy debygrwydd yr enghreifftiau wedi'u labelu yn rhoi cymedr F1 o 0.641. 0.580 oedd canlyniad pedair iaith a ddewiswyd drwy nodweddion teipolegol URIEL. Ond unwaith yr ychwanegwyd ychydig o ddata Runyankore wedi'i labelu, cydgyfeiriodd y dulliau i tua 0.814–0.818.

Nid dull di-ddata mo hwn: mae angen had o enghreifftiau wedi'u labelu yn yr iaith darged. Dyna'r union wers i'r Gymraeg. Yn hytrach na thybio mai Saesneg, Gwyddeleg neu Lydaweg yw'r cymar gorau ar gyfer pob tasg, gall sampl Gymraeg fach ond ofalus ddweud pa drosglwyddiad sy'n gweithio mewn gwirionedd.

O egwyddor gyhoeddus i dystiolaeth gyhoeddus

Ni chafwyd model na set ddata Gymraeg newydd yn ystod y ffenestr hon. Chwiliwyd Nation.Cymru yn benodol. Roedd ei straeon AI yn ymwneud â pholisi grym cwmnïau technoleg, llun gwleidyddol a gynhyrchwyd gan AI a llwyfan clirio cyfreithiol i newyddiaduraeth. Maent yn straeon AI yng Nghymru neu drwy gyfryngau Cymru, ond nid ydynt yn dystiolaeth am allu'r dechnoleg yn Gymraeg.

Mae'n iawn dweud mai wythnos dawel oedd honno i gynnyrch Cymraeg newydd. Mae'r ddau ddatblygiad gwirioneddol yn cysylltu'n dda. Mae UNESCO yn dweud y dylai'r iaith fod yn rhan o'r gwasanaeth o'r dechrau. Mae MultiBLiMP yn dangos bod angen profi'r union fodel ar y diwedd. Mae MGhana-ST yn ychwanegu bod rhaid ailadrodd y prawf; mae'r prawf Iberaidd yn dweud bod rhaid edrych ar wahanol siaradwyr a pharthau; ac mae RunyaNER yn dweud y dylid dewis ffynonellau trosglwyddo drwy dystiolaeth.

Felly, nid “cefnogi'r Gymraeg” yw'r fanyleb lawn. Dylai olygu: derbyn Cymraeg a newid iaith, cyhoeddi'r data a'r hawliau, enwi'r pwynt gwirio, profi grwpiau a thasgau gwahanol, ailadrodd y rhediad, ac agor y canlyniadau i'w harchwilio. Dyna sut mae troi cydnabyddiaeth ryngwladol yn wasanaeth y gellir ymddiried ynddo.

Ffynonellau a darllen pellach