Profi, mesur a meithrin AI Cymraeg
Gwerthusiadau → Claude Opus 4.8

Claude Opus 4.8 masnachol wedi'i fesur

Canlyniadau cyhoeddedig ar gyfer barddoniaeth gaeth yn Gymraeg.

Pedwar gwerthuswr yn astudio modelau haniaethol mewn arena brofi dryloyw

Y ffeithiau

DatblygwrAnthropic
Rhyddhawyd28 Mai 2026
TrwyddedPerchnogol (API)
AmlieithogTabl o 15 iaith yn nogfennaeth Anthropic (Sbaeneg 98% → Iorwba tua 80% o berfformiad y Saesneg) — nid yw'r Gymraeg ynddo. Nododd sylwebaeth ar y cerdyn system fod tasgau amlieithog yn wendid cymharol.

Yr hyn a fesurwyd gennym: y gynghanedd

Profwyd Opus 4.8 â'n protocol set gudd llawn: 40 o themâu na welwyd wrth hyfforddi, pum cynnig ar bob thema, ac un cyfle i ateb, heb gylch adborth nac awgrymiadau odli. Barnwyd pob llinell gan beiriant rheolau'r gynghanedd:

MesurOpus 4.8Ein 9B (DPO r3)
Dilys-am-7-sillaf (crai)20.0%65.0%
Addas + dilys + newydd13.5%1.0%
Llinellau unigryw100%42%
Llinellau croes81

Sgoriodd y model 9B lleol 65.0% ar ffurf, o gymharu ag 20.0% i Opus. Ar y mesur cyfun o linellau dilys, addas a newydd, sgoriodd Opus 13.5% a'r model 9B 1.0%. Roedd pob un o linellau Opus yn unigryw, a chynhyrchodd wyth enghraifft o gynghanedd groes, o gymharu ag un gan y model 9B. Mae'r canlyniadau'n awgrymu cryfderau gwahanol o ran ystyr a rheolaeth ffurfiol.

Roedd rhai o linellau Opus mewn cywair mwy cyfoes na llinellau'r model bach, er enghraifft:

Y bws olaf a basiodd
Gwylan wen ar y glan wag
— llinellau dilys a gafwyd wrth ddefnyddio'r protocol, Gorffennaf 2026

Nodwyd yn adroddiad y Coleg Cymraeg hefyd fod Claude ymhlith yr offer a brofwyd ar destunau academaidd Cymraeg — yn gywirwr defnyddiol, ond yn bathu ambell derm («hunanganolig» yn lle «hunanganolog»).

Canlyniad CymraegBench v0.1

Sgôr gyffredinolRhesymu CymraegCymraeg ymarferolCyfieithu BLEU
81.5685.0278.1169.29

Opus 4.8 sydd yn bumed yn y sgorfwrdd estynedig ar ôl GPT-6 Astra, Opus 5, Muse Spark 1.2 a GPT-5.6 Sol. Un cais yn unig o 1,821 a wrthodwyd. Gweler y sgorfwrdd llawn a'r canlyniadau agored.