Profi, mesur a meithrin AI Cymraeg
Gwerthusiadau → GPT-5.6 Sol

GPT-5.6 Sol masnachol wedi'i fesur

Sgôr gyffredinol o 82.94 a sgôr BLEU cyfieithu o 71.93 yn CymraegBench v0.1.

Pedwar gwerthuswr yn astudio modelau haniaethol mewn arena brofi dryloyw

Y ffeithiau

DatblygwrOpenAI
RhyddhawydRhagflas cyfyngedig ar 26 Mehefin 2026; rhyddhad cyhoeddus ar 9 Gorffennaf 2026
Y teuluTair haen: Sol (y model mwyaf galluog), Terra (canol), Luna (cyflym a rhad)
PensaernïaethHeb ei datgelu; mae ffynonellau allanol yn sôn am ffenestr gyd-destun o 1.5 miliwn o docynnau, ond nid yw hynny wedi'i gadarnhau'n swyddogol
TrwyddedPerchnogol (API yn unig)

Y Gymraeg: dim data gan OpenAI

Gwnaethom chwilio cerdyn system GPT-5.6, hyb diogelwch OpenAI a'r ddogfennaeth i ddatblygwyr, ond nid oes meincnod, honiad na ffigur ar gyfer y Gymraeg. Roedd cerdyn system GPT-5 (arXiv:2601.03267) yn gwerthuso MMLU amlieithog mewn 13 neu 14 o ieithoedd, o Arabeg i Iorwba, ond nid oedd y Gymraeg yn eu plith. Nid yw OpenAI wedi cyhoeddi ffigurau chwaith ar gyfer effeithlonrwydd tocynnu testun Cymraeg.

Nid yw hynny'n golygu nad yw Sol yn gallu defnyddio'r Gymraeg. Canfu adroddiad y Coleg Cymraeg fod modelau cynharach OpenAI ymhlith yr offer mwyaf defnyddiol ar gyfer cywiro a strwythuro Cymraeg academaidd, er bod eu priod-ddull yn aml yn annaturiol. Y broblem yw nad oes mesur cyhoeddus gan y datblygwr. Mae gan Lywodraeth Cymru bartneriaeth ag OpenAI i rannu data Cymraeg, ond nid oes canlyniadau meincnodi wedi'u cyhoeddi o'r bartneriaeth hyd yma.

Canlyniad CymraegBench v0.1

Sgôr gyffredinolRhesymu CymraegCymraeg ymarferolCyfieithu BLEU
82.9484.3281.5671.93

Sol sydd yn bedwerydd ymhlith y deuddeg model blaenllaw, 0.07 pwynt y tu ôl i Muse Spark 1.2, 2.22 o bwyntiau y tu ôl i Claude Opus 5, a 7.19 y tu ôl i GPT-6 Astra, heb wrthod yr un o'r 1,821 o geisiadau. Gweler y sgorfwrdd llawn a'r canlyniadau agored.

Cynghanedd: canlyniad High/Flex

Profwyd Sol ar brotocol cynghanedd Bangor AI â lefel rhesymu High ar haen Flex. Dyma bedair enghraifft o'r 40 o themâu a gadwyd ar wahân i’r hyfforddiant:

Dilys, 7 sillaf (crai)Addas + dilys + newyddLlinellau unigrywCyfran y llinellau a gynhyrchwyd
23.0%16.0%100%42.5%

«Distaw'r lli, dyst yw'r lleuad»

Pysgotwr unig · cynghanedd groes

«Marchnad y dre: lle i'r llu»

Marchnad y dref · cynghanedd sain

«Ar draeth, heb don, mae'n llonydd»

Cwch ar y traeth · cynghanedd lusg

«Trwm yw llaw y distawrwydd»

Chwarel wedi cau · cynghanedd lusg

Derbyniodd y gwiriwr wedi’i gywiro 46 o'r 200 o linellau (23.0%). O'r rhain, roedd 43 yn lân ac yn rhydd o eiriau anhysbys; barnodd Claude Opus 4.8, fel beirniad semantig annibynnol, fod 32 yn berthnasol ac yn addas i'w thema, gan roi sgôr lawn o 16.0%. Roedd pob un o'r 85 o linellau a ddychwelwyd yn unigryw, ac ni chafwyd cyfatebiaeth union i'r 32 yng nghorpws cyhoeddus hysbys y prosiect. Gan nad yw corpws hyfforddi OpenAI ar gael i'w archwilio, dyna derfyn y prawf newydd-deb. Cynhyrchodd y model bum llinell yr un ar 17 o'r 40 thema; ni chafwyd llinellau sgoriadwy o'r 23 arall, a chawsant sero. Mae'r 85 o linellau a'r dyfarniadau wedi'u cyhoeddi er mwyn gallu ailwirio'r cyfansymiau.

Beth sydd nesaf

Mae rhes Sol wedi'i hail-sgorio ac mae'r data sylfaenol bellach ar gael. Y cam nesaf yw adolygiad llenyddol dynol o'r llinellau a sgoriodd uchaf ac ail-sgorio allbynnau crai y modelau eraill gyda'r un fersiwn o'r gwiriwr. Hyd nes hynny, mae'r ffigurau cymharol yn rhai dros dro.