Profi, mesur a meithrin AI Cymraeg
Newyddion → Haf y modelau agored

31 Gorffennaf 2026

Tri model agored newydd, ond dim data am y Gymraeg

Rhyddhawyd tri model pwysau agored mawr mewn saith wythnos. Nid yw'r Gymraeg yn ymddangos yn eu dogfennaeth gyhoeddus.

Pedwar person yn rhannu syniadau mewn stiwdio newyddion liwgar

Mae wedi bod yn haf prysur i fodelau pwysau agored. Wrth i DeepSeek V4-Flash-0731 gael ei ryddhau heddiw, dyma'r trydydd model mawr o Tsieina ers canol Mehefin:

ModelDyddiadParamedrauGweithredolTrwydded
Kimi K3 (Moonshot AI)14 Gorffennaf2.8T (MoE)104BTrwydded K3 bwrpasol
GLM-5.2 (Zhipu AI / Z.ai)13 Mehefin~750B (MoE)~40BMIT
DeepSeek V4-Flash-073131 Gorffennaf284B (MoE)13BMIT

Mae'r tri model yn anelu at bethau tebyg: ffenestr gyd-destun o filiwn o docynnau, y gallu i weithredu fel asiant, a medrau codio cryf. Tsieinëeg a Saesneg yw eu prif ieithoedd. Gellir lawrlwytho pwysau'r tri model — 1.56TB yn achos K3 — ac mae dau ohonynt dan drwydded MIT.

Beth am y Gymraeg?

Ar ôl chwilio dogfennaeth, cardiau model a dadansoddiadau o'r tri, ni ddaethom o hyd i honiad, meincnod na chyfeiriad at y Gymraeg na'r ieithoedd Celtaidd. Mae canllaw i’r ieithoedd a gefnogir gan DeepSeek hefyd yn nodi nad yw'r Gymraeg nac ieithoedd Celtaidd eraill sydd â llai o adnoddau yn ymddangos yn yr haenau cymorth sydd wedi'u dogfennu.

Nid yw hynny'n golygu na allant gynhyrchu Cymraeg. Mae'r corpora gwe mawr yn cynnwys peth deunydd Cymraeg, a bydd ein hadran gwerthusiadau yn profi'r gallu hwnnw. Ond nid oes tystiolaeth fod y labordai eu hunain wedi'i fesur, felly gallai'r gallu ddirywio rhwng fersiynau heb i neb sylwi.

Pam mae hyn yn gyfle serch hynny?

O safbwynt gwaith Cymraeg, y ffigur pwysicaf yn y tabl yw 13 biliwn o baramedrau gweithredol DeepSeek dan drwydded MIT. Er bod gan y model 284 biliwn o baramedrau i gyd, dim ond 13 biliwn sy'n weithredol ar unrhyw adeg. O ganlyniad, gellir ei redeg ar weithfan â 128GB o gof — yr un math o beiriant a ddefnyddir yn ein harbrofion mireinio. Mae trwydded MIT yn caniatáu mireinio, cyhoeddi ac ailddosbarthu'r model heb ganiatâd ychwanegol.

Mewn geiriau eraill, mae'r pwysau a'r trwyddedau'n gwneud prosiect cymunedol i fireinio ac asesu model ar y Gymraeg yn fwy ymarferol. Mae hynny'n rhoi rhagor o opsiynau i ymchwilwyr sydd am fesur y Gymraeg yn uniongyrchol.

Ffynonellau: cyhoeddiadau HuggingFace a GitHub y tri labordy; dadansoddiadau MLQ, DataNorth a MarkTechPost; canllaw ieithoedd deepseekai.guide. Manylion llawn ym mhroffiliau'r adran gwerthusiadau.