4 Medi 2026
Pedwar grant i adeiladu sylfeini AI Cymraeg
Mae Cymru'n buddsoddi mewn data, mapiau, gwybodaeth agored a seilwaith iaith — pedwar maes sy'n ategu ei gilydd a all helpu'r Gymraeg i ffynnu yn oes AI.
Pedwar maes gwaith sy'n ategu ei gilydd
Mae tudalen ddiweddaru Llywodraeth Cymru, a ddiweddarwyd ar 1 Medi, yn cadarnhau pedwar grant technoleg Gymraeg ar gyfer 2026–27.
- Prifysgol Bangor i gyflawni Iriaith, gan ddatblygu a gwella data, modelau AI ac offer technoleg Cymraeg.
- Data Orchard i gyflawni Mapio Cymru, gan ddatblygu a chyfoethogi data daearyddol Cymraeg agored.
- Llyfrgell Genedlaethol Cymru i gyflawni Wici Cymru a’i Phobl, gan ehangu cynnwys a gwybodaeth Gymraeg drwy ddata agored a llwyfannau wici.
- Prifysgol Caerdydd i ddatblygu, defnyddio ac integreiddio gwasanaethau CyTag NLP Cymru, gan adeiladu seilwaith technoleg iaith newydd.
Bydd y prosiectau'n adrodd ar eu cynnydd a'u canlyniadau ddiwedd mis Mawrth 2027. Mae hynny'n rhoi carreg filltir glir i'r rhaglen ac yn cynnig cyfle i rannu'r offer, y data a'r gwersi sy'n deillio o'r buddsoddiad.
Roedd crynodeb Gorffennaf AIsteddfod eisoes wedi cofnodi gwaith parhaus Iriaith a Mapio Cymru. Mae'r diweddariad newydd yn rhoi'r darlun llawn ar gyfer 2026–27 ac yn ychwanegu Wici Cymru a’i Phobl a'r pwyslais penodol ar seilwaith CyTag at gofnod y safle.
O offer sy'n gweithio heddiw i seilwaith yfory
Nid buddsoddi mewn syniadau pell yn unig mo hwn. Mae'r diweddariad swyddogol yn rhoi enghreifftiau o dechnoleg Gymraeg sydd eisoes yn cael ei defnyddio. Mae swyddfa Comisiynydd y Gymraeg yn defnyddio trawsgrifio Teams a Copilot i helpu gyda chofnodion cyfarfodydd; mae swyddfa'r wasg yn defnyddio Trawsgrifiwr, gyda phobl yn gwirio’r trawsgrifiadau; ac mae map etholaethau'r Senedd yn defnyddio gwaith Mapio Cymru.
Mae'r enghreifftiau hyn yn dangos llwybr o ymchwil a data at ddefnydd bob dydd. Pan fo adnodd Cymraeg yn agored ac yn ailddefnyddiadwy, gall sefydliad arall ei droi'n wasanaeth newydd heb ddechrau o'r dechrau.
Mae'r pedwar grant yn ymddangos yn arbennig o addawol o’u hystyried gyda’i gilydd: gall Iriaith gryfhau'r data, y modelau a'r offer sylfaenol; gall Mapio Cymru sicrhau bod enwau a gwybodaeth am leoedd Cymru ar gael yn Gymraeg; gall Wici Cymru a’i Phobl ehangu'r wybodaeth Gymraeg y gall pobl a systemau ei defnyddio; a gall CyTag ddarparu gwasanaethau prosesu testun y gellir eu cynnwys mewn offer eraill.
Rydym yn dod i'r casgliad hwn ar sail y disgrifiadau cyhoeddus; nid disgrifio cynllun ffurfiol i integreiddio'r prosiectau. Ond mae'r potensial yn glir: yn hytrach na chefnogi un ap ar ei ben ei hun, mae Cymru'n buddsoddi mewn sawl rhan o'r seilwaith iaith.
Nid yw gwerth pob grant na manylion terfynol yr allbynnau wedi'u cyhoeddi ar y dudalen ddiweddaru. Mae hynny'n naturiol ar gam cyhoeddi rhaglen. Bydd adroddiadau mis Mawrth yn gyfle i weld y setiau data, y gwasanaethau, y trwyddedau a'r mesurau llwyddiant sy'n deillio o'r gwaith.
Gwers galonogol o Armenia
Daeth enghraifft galonogol o iaith arall yr wythnos hon. Mae From Zero to Hero: An Open LLM Ecosystem for Armenian, rhagargraff a gyflwynwyd ar 3 Medi, yn dangos beth all ddigwydd pan fuddsoddir mewn data, modelau ac offer cysylltiedig ar yr un pryd.
Mae'r gwaith yn cysylltu ArmWeb, 4.37 miliwn o ddogfennau newyddion Armeneg; ArmSTEM, 373,000 o broblemau mathemateg a gwyddoniaeth Saesneg–Armeneg; ac arm-gemma-e4b, addasiad Gemma 9 biliwn o baramedrau gyda'r rysáit hyfforddi a'r cod.
Yn ôl cerdyn y model, cododd y cymedr ar chwe thasg Armeneg o 0.477 i 0.499, a Belebele o 0.619 i 0.716. Roedd y broses arbrofi ei hun yn gynhyrchiol: dangosodd y tîm fod data newyddion yn unig yn gallu gwella rhuglder ond gwanhau gwybodaeth, ac yna canfu fod ychwanegu 6% o ddata STEM wedi'i gyfieithu a'i wirio yn gwrthdroi'r golled.
Mae'r tîm hefyd yn gwirio gorgyffwrdd rhwng data hyfforddi a phrofion. Mae hynny'n helpu eraill i ddeall pam y cododd sgôr ac i adeiladu ar y gwaith yn hyderus.
Model sylfaen yw hwn, heb fireinio cyfarwyddiadau na diogelwch, ac mae'r pwysau o dan drwydded Gemma. Serch hynny, mae'r casgliad Armeneg yn dangos gwerth adnoddau cysylltiedig: corpws, data cyfochrog, model, dull hyfforddi a gwerthusiad mewn un pecyn.
Mae hyn yn awgrymu y gallai prosiectau Cymru hefyd elwa ar ategu gwaith ei gilydd. Mae Iriaith, Mapio Cymru, Wici Cymru a’i Phobl a CyTag yn cynnig rhannau gwahanol o seilwaith tebyg, wedi'i addasu i anghenion a chryfderau'r Gymraeg.
Dau syniad ymarferol o Nepal
Mae Arkios, model dwyieithog Nepaleg–Saesneg 1.04 biliwn o baramedrau, yn cynnig syniad defnyddiol ar gyfer gwerthuso Cymraeg. Ar Belebele, cafodd 0.240 yn Nepaleg a 0.236 yn Saesneg pan oedd rhaid ateb â llythyren—yn agos at y sgôr o 0.250 y gellid ei disgwyl drwy ddyfalu yn y ddwy iaith. Pan sgoriwyd testun yr ateb ei hun, cododd y canlyniadau i 0.306 a 0.387.
Roedd y prawf dwyieithog yn helpu'r tîm i weld mai fformat yr ateb oedd yn peri rhan o'r broblem, nid y Nepaleg yn unig. Gall prosiectau Cymru ddefnyddio'r un egwyddor: profi'r un dasg yn Gymraeg ac yn Saesneg, mewn mwy nag un ffurf, er mwyn deall yn union ble mae cynnydd yn digwydd.
Mae SpeakPay yn dangos pa mor bell y gall set ddata fach a phenodol ein harwain. Ar 403 o orchmynion ariannol Nepaleg, gostyngodd LoRA ar Whisper large-v2 y gyfradd gwallau geiriau o 129.95% i 42.58%, a chynyddodd cywirdeb rhifolion o 0 i 73.9%.
Roedd cyfradd llwyddiant trafodion yn dal yn 33.33%, felly mae rhagor o waith i'w wneud cyn defnyddio’r system yn ymarferol. Ond mae'r cynnydd yn dangos bod buddsoddi mewn ychydig o ddata, wedi'u targedu at dasg go iawn, yn gallu newid gallu model yn sylweddol. Mae hynny'n arbennig o berthnasol i wasanaethau Cymraeg sy'n trin enwau, rhifau a lleoedd.
Cyfieithu lleol yn symud ymlaen
Roedd TranslatePsy-AfriSLM eisoes yn erthygl yr wythnos ddiwethaf. Y datblygiad newydd yw bod Tether wedi lansio'r teulu'n ffurfiol ar 2 Medi, ynghyd ag AfriNano ar gyfer wyth iaith Affrica ac EuroNano ar gyfer naw iaith Ewropeaidd.
Mae'r post technegol Nano yn nodi sgôr COMET gyfartalog o 0.860 ar gyfieithu ieithoedd Ewropeaidd i'r Saesneg—98.4% o sgôr y model NLLB-200 a ddefnyddiwyd ar gyfer cymharu—mewn model meintiedig 42MB; mae haen leiaf y teulu'n 17MB. Mae cardiau EuroNano ac AfriNano yn nodi Apache-2.0.
Mae'r patrwm yn addawol i'r Gymraeg: modelau bach sy'n gallu rhedeg yn lleol, gweithio heb gysylltiad cyson â'r rhyngrwyd, a chadw data ar y ddyfais. Nid oes Cymraeg yn y teuluoedd Nano newydd, ond maent yn dangos bod cyfieithu amlieithog effeithiol yn symud tuag at ddyfeisiau bob dydd.
Mae un manylyn trwyddedu'n werth ei nodi i'r rhai sydd am ailddefnyddio'r adnoddau: mae pwysau AfriSLM dan drwydded Apache-2.0, tra bo'r cymysgedd hyfforddi synthetig yn CC BY-NC 4.0. Mae cofnodi'r ddau'n glir yn helpu timau i ddewis yr adnodd cywir.
Cyfle i Gymru adeiladu seilwaith cyflawn
Ni ddaeth model neu set ddata Gymraeg newydd arall i'r amlwg rhwng 29 Awst a 4 Medi. Ond mae'r cyhoeddiad buddsoddi yn fwy sylfaenol nag un model: mae'n cefnogi'r adnoddau y gall llawer o fodelau a gwasanaethau eu defnyddio dros amser.
Mae diddordeb ar lawr gwlad hefyd yn dechrau ymddangos. Dywedodd Dafydd Thomas ei fod yn adeiladu ap sgwrsio AI i ddysgwyr Cymraeg. Gwaith ar y gweill yw hwn, heb arddangosiad na gwerthusiad cyhoeddus eto, ond mae'n enghraifft fach o'r math o greadigrwydd y gall rhwydwaith cryfach o ddata ac offer ei gefnogi.
Y darlun cadarnhaol yw bod Cymru'n gweithio ar sawl lefel ar yr un pryd. Mae offer presennol eisoes yn helpu gyda chyfarfodydd, trawsgrifio a mapiau; mae'r grantiau newydd yn ymestyn data, gwybodaeth a seilwaith; ac mae gwaith rhyngwladol yn cynnig dulliau y gellir eu haddasu i'r Gymraeg.
Erbyn mis Mawrth, byddwn yn gwybod mwy am yr hyn y mae pob prosiect wedi'i greu. Am y tro, mae'r buddsoddiad yn arwydd clir o uchelgais: nid ychwanegu Cymraeg at un cynnyrch yn unig, ond adeiladu'r sylfeini i lawer o wasanaethau Cymraeg dyfu.
