20 Ebrill 2026
Jupiter-N-120B: model mawr â hyfforddiant Cymraeg, ar gael i bawb
Mae Locai Labs ac UCL wedi rhyddhau model, dull ôl-hyfforddi Cymraeg a'r setiau data cysylltiedig yn agored.

Ddoe cyflwynodd George Drayson o Locai Labs ac UCL adroddiad technegol Jupiter-N i arXiv, ac mae pwysau'r model eisoes ar gael ar Hugging Face. Mae'r model wedi'i seilio ar NVIDIA Nemotron-3-Super-120B-A12B, sef model LatentMoE hybrid (Mamba-2, MoE a sylw; 120 biliwn o baramedrau, cyd-destun o filiwn o docynnau, a rhesymu y gellir ei droi ymlaen neu i ffwrdd). Cafodd ei ôl-hyfforddi drwy LoRA (r=16, α=32) at dri diben: cryfhau ei allu i weithredu fel asiant, ei gysoni â chyd-destun diwylliannol Prydain, a gwella ei Gymraeg.
Y canlyniadau Cymraeg
Prin yw'r canlyniadau meincnodi Cymraeg a gyhoeddir gan ddatblygwyr. Mae adroddiad Jupiter yn ychwanegu dau fesur: cynnydd o 18 pwynt ar ARC-Easy Cymraeg a 5.25 pwynt ar MMLU-Lite Cymraeg o'u cymharu â'r model sylfaen. Daw'r data o gorpora cyfochrog Prifysgol Bangor — trafodion y Senedd a deddfwriaeth y DU — ynghyd â data cyfarwyddiadau a gyfieithwyd â pheiriant.
Mae'r setiau data hefyd wedi'u cyhoeddi. Maent yn cynnwys nemotron-chat-welsh, cofnod y Cynulliad a'r Senedd (cofnodycynulliad_en_cy), deddfwriaeth ddwyieithog, is-deitlau a chynnwys Cymraeg o Wikimedia. Mae rhagor o fanylion ar dudalen Locai Labs ac ym mhost blog Drayson am gasglu'r data cyfieithu.
«Forget-Me-Not» — cadw'r gallu presennol wrth ddysgu'r newydd
Un elfen berthnasol o'r adroddiad yw'r fframwaith gwrth-anghofio. Mae'n ailgyflwyno data synthetig a gynhyrchwyd gan y model sylfaen gwreiddiol, er mwyn cadw galluoedd craidd fel codio a rhesymu wrth ychwanegu'r Gymraeg. Mae ei sgôr ar waith fel asiant, er enghraifft, yn gwella 9.1 pwynt ar Terminal Bench 2. Mae'r awduron yn disgrifio'r dull fel «templed atgynyrchadwy ar gyfer ôl-hyfforddiant sofran»: dull y gallai cenhedloedd a chymunedau iaith ei astudio a'i addasu.
O addewid ym mis Medi i ryddhau ym mis Ebrill
Ym mis Medi 2025, cyhoeddodd Bangor, UCL, NVIDIA ac Nscale brosiect UK-LLM i ôl-hyfforddi Llama Nemotron Super 49B a Nemotron Nano 9B ar ddata Cymraeg. Roedd ieithyddion Bangor i wirio'r cyfieithiadau, gan gynnwys y treigladau. Er bod hwnnw'n gyhoeddiad cyffrous, nid oes pwysau cyhoeddus na gwasanaeth API gweithredol wedi dod o'r prosiect eto.
Mae Jupiter-N-120B yn cynnig man cychwyn agored ar raddfa 120B ar gyfer ymchwil i ôl-hyfforddiant Cymraeg, dan Drwydded Model Agored Nemotron. Mae Bangor AI yn ei astudio fel un opsiwn ar gyfer arbrofion barddoniaeth ac ymchwil iaith ehangach.
Ffynonellau: arXiv 2604.17429; HuggingFace locailabs; cyhoeddiadau Bangor/NVIDIA Medi 2025. Proffil llawn y model yn yr adran gwerthusiadau.
