Profi, mesur a meithrin AI Cymraeg
Gwerthusiadau → Modelau agored Cymraeg

Modelau pwysau agored: y canlyniadau Cymraeg

Pedwar model ar ddeg agored neu leol, wedi'u profi ar yr un setiau craidd â'r modelau blaenllaw.

Gwerthuswyr yn cymharu modelau agored mewn arena brofi dryloyw

Profwyd Muse Spark 1.2, y tri model Qwen3.8, GLM-5.3 Flash a GLM-5.3 drwy OpenRouter, DeepSeek V4.1 Flash yn lleol ar wyth GPU, Jupiter-N-120B ar glwstwr DGX Spark a'r modelau llai ar RTX 4090. Cafwyd 91,950 o ymatebion: 33,657 yr un gan Jupiter a Chaernarfon Cymraeg Instruct, a 2,053 yr un gan ddeuddeg model arall. Defnyddiwyd tymheredd 0 lle'r oedd yr API yn ei gynnal a fformat y cyfarwyddyd a nodir gan ddatblygwr pob model; defnyddiwyd hedyn hap 1 lle'r oedd yr API yn ei gynnal. Mae'r sgôr gyffredinol yn defnyddio'r un 19 o setiau craidd â phrif sgorfwrdd CymraegBench; nid yw'r 232 o achosion Archwiliad Iaith CCC yn cyfrannu at y sgôr hon.

Safle estynedig Model Sgôr gyffredinol Rhesymu Cymraeg Cymraeg ymarferol Cyfieithu BLEU Annilys
3 Muse Spark 1.2 pwysau agored 83.0185.6880.3371.460.00%
6 Qwen3.8 2.4T-A95B pwysau agored 81.0986.2875.8960.840.00%
7 Qwen3.8 Flash API swyddogol 79.8184.0675.5658.790.05%
10 GLM-5.3 Flash pwysau agored 74.3876.2172.5658.410.00%
11 GLM-5.3 pwysau agored 73.3877.3169.4458.050.00%
12 Qwen3.8 27B pwysau agored 70.4779.8361.1146.030.00%
13 DeepSeek V4.1 Flash pwysau agored 69.4576.2362.6769.030.00%
17 Qwen3.5 9B pwysau agored 55.1057.9852.2237.060.00%
18 Jupiter-N-120B pwysau agored 48.8752.7045.0443.850.37%
19 Mwydryn 7B fersiwn 2 pwysau agored 30.3739.9620.7841.890.83%
20 Mistral-7B-Cymraeg-Welsh-v2 pwysau agored 30.0940.8519.3331.390.49%
21 Mwydryn Phi-2 pwysau agored 26.9036.4717.339.112.83%
22 Caernarfon 3B Cymraeg Instruct v0.1 wedi'i fireinio 10.8316.804.8622.003.52%
23 Techiaith Llama 3.2 1B Welsh SFT pwysau agored 9.8717.182.561.0534.53%

Annilys yw allbwn gwag, allbwn a gyrhaeddodd y terfyn tocynnau neu achos sy'n fwy na ffenestr gyd-destun y model; mae'n sgorio sero. Cyfrifir y ganran dros yr holl achosion yn y prawf, gan gynnwys CCC. Cafodd pob model sgôr ar 100% o’r achosion ac ni chafwyd gwall seilwaith heb ei ddatrys.

Beth mae'r canlyniadau'n ei ddweud?

Muse Spark 1.2 yw'r model pwysau agored uchaf, yn drydydd yn y tabl cyfan â 83.01. Qwen3.8 2.4T-A95B yw'r ail fodel agored uchaf, yn chweched â 81.09. Daeth gwasanaeth cyhoeddus Qwen3.8 Flash yn seithfed â 79.81; mae Qwen yn ei ddisgrifio fel fersiwn sy'n seiliedig ar y model pwysau agored Flash-Next, felly nid ydym yn honni bod y gwasanaeth yn defnyddio'r union fodel pwysau agored. Daeth GLM-5.3 Flash yn ddegfed â 74.38, GLM-5.3 yn unfed ar ddeg â 73.38, Qwen3.8 27B yn ddeuddegfed â 70.47, a DeepSeek V4.1 Flash yn drydydd ar ddeg â 69.45. Mae pwysau'r ddau fodel GLM a DeepSeek ar gael. Sgoriodd Qwen3.5 9B 55.10 ar un RTX 4090, Jupiter 48.87, Mwydryn 7B v2 30.37, a Mistral Cymraeg v2 30.09.

Mae canlyniad Techiaith 1B yn datgelu problem wahanol: nid gwybodaeth yn unig sy'n brin, ond y gallu i ddilyn cyfarwyddyd byr a gorffen yr ateb. Defnyddiwyd union fformat Alpaca arddangosiad swyddogol Techiaith a'i osodiad repetition_penalty = 1.15; serch hynny, aeth dros draean yr allbynnau at y terfyn. Mae hynny'n ganfyddiad defnyddiol ar gyfer y rownd fireinio nesaf.

Caernarfon: mae addasydd Cymraeg Instruct yn codi'r model uwchlaw Techiaith 1B, ond mae sgôr ymarferol o 4.86 yn dangos faint o waith sydd eto i'w wneud. Mae prawf ar yr hen fodel sylfaenol wedi'i gadw yn yr archif, ond nid yw bellach yn ymddangos yn y prif sgorfwrdd.

Data ac ailadrodd y profion