الأبحاث · تقرير تقييم · سبتمبر 2026

L3: التدقيق اللغوي العربي مقابل
26 إعدادًا من النماذج اللغوية الكبيرة

على معيار من جمل عربية حقيقية راجعها خبير لغوي، بلغ L3 نسبة 80.29% على مقياس F0.5 للتعديلات، مقابل 44.68% لنموذج Claude Fable 5.1، أقوى إعدادات النماذج اللغوية الكبيرة التي اختبرناها.

تقرير تقييم

  • تاريخ النشر
  • تاريخ التقييم9 سبتمبر 2026، الإصدار 1.0
  • جهة الإعدادفريق البحث في Lisan
80.29%مقياس F0.5 للتعديلاتمقيس · التالي 44.68% لنموذج Claude Fable 5.1
84.54%دقة الرصدمقيس · التالي 64.21% لنموذج Claude Fable 5.1
66.85%استدعاء الرصدمقيس · التالي 41.08% لنموذج GPT-5.6 Sol
96.38%دقة التصحيح بعد التطبيعمقيس · مشروطة برصد صحيح
55.96%التطابق التام للجملةمقيس · Claude Fable 5.1 بنسبة 27.98%
98.84%ROUGE-1 F1مقيس · تداخل الكلمات مع المرجع · Claude Fable 5.1 بنسبة 96.56%
52.28رمزًا في الثانيةمقيس · الثاني بعد Qwen 3.8 27B على Groq بمعدل 66.98
0.000014كيلوواط ساعة لكل 1,000 رمز، على نطاق المسرّعمقيس على NVIDIA A10 · 0.000042 بمعامل المنظومة الكاملة بثلاثة أضعاف، وهو تقدير

يجمع F0.5 بين الدقة والاستدعاء مع ترجيح الدقة. والدقة نسبة التغييرات المقترحة التي وقعت حيث غيّر الخبير اللغوي النص أيضًا؛ والاستدعاء نسبة تعديلات الخبير التي وجدها النظام. التعريفات الكاملة في المنهجية.

يتصدر L3 مقياس F0.5 للتعديلات بنسبة 80.29% مقابل 44.68% لـ Claude Fable 5.1

مقياس F0.5 للتعديلات، رصد المقاطع بحدودها الدقيقة، أفضل عشرة إعدادات. الأعلى أفضل. يرجّح F0.5 الدقة على الاستدعاء، لأن التغييرات غير الضرورية أعلى كلفة من التعديلات الفائتة.

رصد المقاطع بحدودها الدقيقة، بمتوسط جزئي، أي بتجميع كل مقاطع التعديل قبل حساب النسبة. مخرج واحد لكل نظام، والاقتراح الأول فقط من L3، والتعليمات الحرفية نفسها المكونة من أربعة أسطر. وكل درجات المنافسين من تشغيلنا نحن لخدمة كل مزود، لا من منشورات المزودين. انظر المنهجية؛ ويعرض الجدول كل الإعدادات.

احتلّ L3، محرك Lisan اللغوي، المرتبة الأولى في كل مقياس رئيسي في هذا التقييم: دقة رصد المقاطع بحدودها الدقيقة، والاستدعاء، وF1، وF0.5، ودقة التصحيح الحرفية وبعد التطبيع، والتطابق التام للجملة، وROUGE-1 وROUGE-L. وبلغ على F0.5 نسبة 80.29%، بفارق 35.61 نقطة عن Claude Fable 5.1 الذي بلغ 44.68%. مقيس.

وقد تغيّر المنافس الأقوى بتغيّر المقياس، وهو أمر يستحق أن يُقال بوضوح. فكان Claude Fable 5.1 التالي في الدقة وفي F0.5. وكان Claude Opus 5 التالي في F1 بنسبة 34.58% مقابل 74.66% لـ L3. وكان GPT-5.6 Sol التالي في الاستدعاء بنسبة 41.08% مقابل 66.85%. ولم يحلّ أي إعداد من النماذج اللغوية الكبيرة ثانيًا في كل المقاييس.

مهمتان لا مهمة واحدة

التدقيق اللغوي قراران متتابعان. على النظام أن يحدد أولًا موضع الخطأ في النص، ثم يقرر ما الذي يضعه مكانه. ونحن نقيس المهمتين كلًّا على حدة، لأن نظامًا ما قد يجيد إحداهما ويقصّر في الأخرى.

يُقاس الرصد على المقاطع بحدودها الدقيقة. فكل تعديل مرجعي يشغل مقطعًا من الجملة الأصلية محددًا بمواضع الحروف، ولا يحصل النظام على نقطة رصد إلا إذا غيّر ذلك المقطع نفسه بالضبط. أما تغيير كلمة مجاورة، أو نصف الكلمة الصحيحة، فيُحسب فواتًا وإنذارًا كاذبًا في آن واحد. وتُعامَل الإضافات مواضعَ صفرية العرض، وقد يُعدّ تغيير علامة الترقيم مقطعًا مستقلًا.

ولا يُقاس التصحيح إلا حيث نجح الرصد. فمن بين المقاطع التي حددها النظام تحديدًا صحيحًا، نسأل: كم بديلًا منها طابق مرجع الخبير اللغوي، حرفًا بحرف أولًا، ثم بعد التطبيع العربي. ولهذا تبقى دقة التصحيح رقمًا مشروطًا، ونصرّح بذلك حيثما ورد.

المقياس الرئيسي هو F0.5، الذي يجمع بين الدقة والاستدعاء مع ترجيح الدقة. ففي التدقيق المؤسسي، يكلّف التغيير غير الضروري عادةً أكثر مما يكلّف التعديل الفائت: إذ لا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. ويعبّر F0.5 عن هذا التفاوت. ونورد إلى جانبه F1 والدقة والاستدعاء، حتى لا يُطلب من أحد أن يقبل هذا الترجيح دون دليل.

L3 هو النظام الوحيد الذي يجمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60%

الدقة في مقابل الاستدعاء لكل إعداد له صف نتائج. الأعلى أفضل على المحورين. الاستدعاء على المحور الأفقي والدقة على المحور الرأسي؛ ويشير الربع المظلل إلى دقة تتجاوز 80% مع استدعاء يتجاوز 60%.

رصد المقاطع بحدودها الدقيقة. خطوط إرشادية عند دقة 80% واستدعاء 60%. شُغّل GPT-6 Astra بإعدادي استدلال، ولا تحمل ملاحق التقرير إلا صفًا واحدًا له، فيظهر نقطة واحدة. النقاط المسماة: L3، وClaude Fable 5.1 (أدق نموذج لغوي كبير)، وGPT-5.6 Sol (أعلى استدعاء بين النماذج)، وClaude Opus 5 (أفضل F1 بين النماذج).

الدقة والاستدعاء

L3 هو النظام الوحيد الذي يجمع بين دقة تتجاوز 80% واستدعاء يتجاوز 60% على هذا المعيار. فدقته البالغة 84.54% تعني أن معظم التغييرات التي اقترحها وقعت على مقطع غيّره الخبير اللغوي أيضًا. واستدعاؤه البالغ 66.85% يعني أنه أصاب أغلب التعديلات المرجعية وفاته باقيها. مقيس.

وتقصّر النماذج اللغوية الكبيرة بطريقتين مختلفتين. فكان Claude Fable 5.1 الأدق بنسبة 64.21%، لكنه لم يجد سوى 20.15% من التعديلات المرجعية: غيّر قليلًا، وكان ما غيّره صائبًا في الغالب. وأصاب GPT-5.6 Sol أكبر حصة من التعديلات المرجعية بين النماذج بنسبة 41.08%، لكن بدقة 25.03%، أي إن معظم تغييراته لم تكن مسوّغة. وتتجمع معظم الإعدادات الأخرى في الزاوية السفلى اليسرى من المخطط، متقاربةً على المحورين.

هذا الشكل هو الحجة العملية لاعتماد F0.5 بدلًا من عدّ التصحيحات الخام. فالنظام الحذر ذو الدقة العالية والاستدعاء المنخفض يترك الأخطاء في الوثيقة. والنظام المندفع ذو الملامح المعاكسة يملأ قائمة المراجعة بتغييرات يضطر المحرر إلى رفضها. ويكافئ المعيار النظام القادر على الأمرين معًا، ونظام واحد فعل ذلك.

بعد رصد صحيح، يطابق بديل L3 المرجع في 96.38% من الحالات، بفارق 1.84 نقطة عن Claude Fable 5.1

دقة التصحيح، حرفيًا وبعد التطبيع العربي، مشروطة برصد صحيح. الأعلى أفضل. يبدأ المحور من 70%.

مشروطة برصد صحيح، فاقرأ هذه النسب إلى جانب الاستدعاء: تنطبق نسب Claude Fable 5.1 على مقاطع مرصودة أقل بكثير من مقاطع L3. عشرة إعدادات مرتبة بحسب النسبة بعد التطبيع. مفتاح الرسم: البديل الحرفي، وبعد التطبيع العربي.

جودة التصحيح بعد الرصد

متى حدد L3 مقطعًا تحديدًا صحيحًا، طابق بديله المرجع حرفًا بحرف في 89.79% من الحالات، وفي 96.38% منها بعد التطبيع العربي. ويزيل التطبيع التشكيل والتطويل، ويوحّد صور الألف والهمزة والتاء المربوطة، حتى لا يُحكم على اقتراح صحيح بالخطأ بسبب حركة زائدة أو ناقصة. مقيس.

هذه الأرقام مشروطة، والتحفظ هنا ليس مجرد إجراء شكلي. فقد بلغ Claude Fable 5.1 نسبة 89.07% حرفيًا و94.54% بعد التطبيع، بفارق 1.84 نقطة خلف L3 في النسبة المطبّعة. غير أن هذه النسب لا تنطبق إلا على المقاطع التي رصدها، وهي جزء صغير من التعديلات المرجعية. فالنظام الذي يغيّر قليلًا ويحسن ما يغيّره قد يسجّل دقة مشروطة عالية وهو يترك معظم الأخطاء في مكانها. تخبرك دقة التصحيح بمدى الثقة في اقتراح مقبول؛ ويخبرك الاستدعاء بمقدار ما بلغه النظام من الوثيقة. ولا يغني أحد الرقمين عن الآخر.

يطابق L3 الجملة المرجعية كاملة في 55.96% من الجمل، ضعف نسبة Claude Fable 5.1 البالغة 27.98%

التطابق التام على مستوى الجملة، أفضل عشرة إعدادات. الأعلى أفضل. نسبة الجمل التي يطابق مخرجها الكامل المرجع الكامل حرفًا بحرف.

صارم عن قصد: تعديل فائت واحد، أو تعديل زائد واحد، أو حرف مختلف واحد يجعل الجملة خاطئة. يتعادل GPT-5.6 Terra وGemini 2.5 Flash عند 18.49% ويحتفظان بترتيب المصدر. نسب فقط؛ لا أعداد جمل في الشكل.

الدقة على مستوى الجملة كاملة

تصف مقاييس المقاطع التعديلات، أما المحررون فيتسلمون جملًا. ويطرح التطابق التام للجملة السؤال من طرف إلى طرف: بعد أن ينتهي النظام، هل الجملة كلها مطابقة لما كان الخبير اللغوي سيكتبه؟ اجتاز L3 هذا الحد في 55.96% من الجمل، أي ضعف نسبة Claude Fable 5.1 البالغة 27.98%. مقيس.

والمقياس صارم بحكم تصميمه. فحركة زائدة واحدة، أو نقطة ناقصة واحدة، أو خطأ واحد لم يُمسّ، يُسقط الجملة كلها، ولهذا تقع كل النسب هنا دون نسب التصحيح المشروطة أعلاه بكثير. وهو ملخص مفيد لسلسلة المعالجة كاملة، لا معدل خطأ، ولا يحل محل التحليل على مستوى المقاطع.

يحافظ L3 على نص المرجع وهو يصححه: 98.84% على ROUGE-1 F1 مقابل 96.56% لـ Claude Fable 5.1

ROUGE-1 F1 في مقابل مرجع الخبير اللغوي، أفضل عشرة إعدادات. الأعلى أفضل. تداخل الكلمات على مستوى الجملة بعد إزالة التشكيل والتطويل؛ يمتد المحور من 95 إلى 100.

يعرض المحور من 95 إلى 100؛ وتتجاوز الأنظمة العشرة كلها 95. أما ROUGE-L الذي يشترط ترتيب الكلمات أيضًا فيظهر في التلميح والجدول. متوسط كلي لكل جملة.

الأمانة للمرجع

يقيس ROUGE مقدار ما يبقى من الجملة المرجعية في المخرج، أيًا كان ما يقوله تقييم التعديلات. وتعني القيم العالية أن النظام صحح النص من غير أن يعيد كتابته. سجّل L3 نسبة 98.84% على ROUGE-1 F1 و98.83% على ROUGE-L F1، متقدمًا على Claude Fable 5.1 بفارق 2.28 و2.29 نقطة. مقيس.

وهنا تفصيلان مهمان. يبدأ المحور من 95 لأن كل نظام في العشرة الأوائل يتجاوزه؛ فعلى محور كامل تبدو العلامات متطابقة، أما مخطط أعمدة مقطوع المحور فيبالغ. كما أن قيمتي ROUGE-1 وROUGE-L لدى L3 تكادان تتطابقان، ونقرأ ذلك على أنه احتفاظ بمفردات المرجع وبترتيبها معًا: يغيّر المحرك الخطأ ويترك بنية الجملة على حالها. ويروي مقياس التداخل المجموعي القديم، المحتفظ به للتتبع لا مقياسًا رئيسيًا، القصة نفسها بنسبة 91.45% مقابل 88.93%.

كيف تبدو التصحيحات

تصف الأرقام المعيار، وتُظهره الجمل. البطاقات أدناه مأخوذة من صفوف المعيار، وتعرض النص الأصلي، ومرجع الخبير اللغوي، ومخرج L3، ومخرجات عدد من إعدادات النماذج اللغوية الكبيرة، كما وردت حرفيًا. تأتي الأخطاء الصريحة أولًا. أما البطاقتان الأخيرتان فموسومتان بعبارة «معيار تحريري»: الجملة الأصلية سليمة نحويًا، والمرجع يطبّق الاصطلاح التحريري الذي التزمه الخبير اللغوي، وقد طُلب من النماذج ألا تعيد الصياغة. تُظهر هذه الصفوف ما تفعله الطبقة التحريرية في المحرك، لا إخفاق النماذج في النحو، وتصرّح التعليقات بذلك.

وثمة تنبيه، من باب الأمانة، يسري على البطاقات كلها. قدّم كل نظام مخرجًا واحدًا لكل جملة، وقدّم L3 اقتراحه الأول فقط، وكانت النماذج مقيدة بتعليمات صارمة. وحيثما طابق نموذج المرجع، تقول البطاقة ذلك.

مثال 1

خطأ صريح

خطآن في كرسي الهمزة ونقطة ختامية ناقصة؛ طابق L3 المرجع تمامًا، وصححت النماذج المعروضة الهمزة الثانية وتركت الأولى.

النص الأصلي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيئ (مقطع خاطئ) له طريقه إلى النجاح (مقطع خاطئ)

المرجع

نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

L3
مطابق

نعم يمكن لكتاب واحد يقرؤه (تصحيح) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

Claude Fable 5.1
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

Claude Opus 5
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

GPT-6 Astra
جزئي

نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح. (تصحيح)

GPT-5.6 Sol
جزئي

نعم يمكن لكتاب واحد أن يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

Gemini 3.1 Pro
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

DeepSeek V4 Pro
جزئي

نعم يمكن لكتاب واحد يقرأه (مقطع خاطئ) الإنسان في مرحلة من عمره فيجد فيه ما يضيء (تصحيح) له طريقه إلى النجاح (مقطع خاطئ)

لماذا المرجع صحيح

تقع الهمزة على حامل مختلف بحسب الحركات المحيطة بها: ففي «يقرؤه» يجب أن تُكتب على واو لأن الهمزة نفسها مضمومة، والضمة أقوى من فتحة الحرف الذي قبلها، وفي «يضيء» يجب أن تُكتب مفردة على السطر بعد حرف مدّ؛ وقد استُخدم في الكلمتين حامل خاطئ، كما يختم المرجع الجملة بنقطة.

  • موضع الهمزة
  • الترقيم
مثال 2

خطأ صريح

قاعدة كلاسيكية لموضع الهمزة داخل مصطلح تقني شائع جدًا؛ ولم يصل أي إعداد من النماذج اللغوية الكبيرة إلى رسم المرجع.

النص الأصلي

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

المرجع

ما المقصود بالتحليلات التنبئية (تصحيح)؟

L3
مطابق

ما المقصود بالتحليلات التنبئية (تصحيح)؟

Claude Fable 5.1
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

Claude Opus 5
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

GPT-6 Astra
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

GPT-5.6 Sol
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

Gemini 3.1 Pro
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

DeepSeek V4 Pro
دون تغيير

ما المقصود بالتحليلات التنبؤية (مقطع خاطئ)؟

لماذا المرجع صحيح

حين يتحول الاسم «تنبؤ» إلى الصفة «تنبئية» تنتقل الهمزة من حامل الواو إلى حامل الياء؛ وقد أبقى النص الأصلي رسم الاسم داخل الصفة، وهو خطأ إملائي تركته النماذج اللغوية الكبيرة كلها من غير مساس.

  • موضع الهمزة
مثال 3

خطأ صريح

الأعداد من ثلاثة إلى عشرة تخالف المعدود في التذكير والتأنيث؛ طابقت خمسة إعدادات من 26 المرجع، ومنها Gemini 3.1 Pro بين المخرجات المعروضة، وترك الباقي العدد كما كُتب.

النص الأصلي

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

المرجع

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

L3
مطابق

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

Claude Fable 5.1
دون تغيير

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

Claude Opus 5
دون تغيير

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

GPT-6 Astra
دون تغيير

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

GPT-5.6 Sol
دون تغيير

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئتي تجربة المرضى وسلامتهم.

Gemini 3.1 Pro
مطابق

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمسة نجوم (تصحيح)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

DeepSeek V4 Pro
دون تغيير

وكجزء من التقييم، حصل مستشفى آدم فيتال على تصنيف خمس نجوم (مقطع خاطئ)، وهو أعلى تصنيف متاح، ضمن فئة تجربة المرضى وسلامتهم.

لماذا المرجع صحيح

تخالف الأعداد من ثلاثة إلى عشرة في العربية جنس المعدود؛ و«نجم» مذكر، فيجب أن يأتي العدد «خمسة» بصيغة المؤنث المختومة بالتاء المربوطة.

  • مطابقة العدد للمعدود
مثال 4

خطأ صريح

اسم مؤنث يبدو مذكرًا؛ طابقت عدة إعدادات المرجع هنا، ومنها Claude Fable 5.1.

النص الأصلي

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

المرجع

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

L3
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

Claude Fable 5.1
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

Claude Opus 5
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

GPT-6 Astra
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

GPT-5.6 Sol
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

Gemini 3.1 Pro
مطابق

كيف لأحد أن يمتلك مثل هذه الكبرياء (تصحيح)؟

DeepSeek V4 Pro
دون تغيير

كيف لأحد أن يمتلك مثل هذا الكبرياء (مقطع خاطئ)؟

لماذا المرجع صحيح

«الكبرياء» اسم مؤنث في العربية، لأن الألف الممدودة في آخره ألف تأنيث، فيجب أن يأتي اسم الإشارة بصيغة المؤنث «هذه».

  • المطابقة في الجنس
مثال 5

خطأ صريح

نص مشوّه بشدة؛ استعادت معظم النماذج الكلمات، وطابق Gemini 3.1 Pro المرجع من بين المخرجات المعروضة (كما طابقه GPT-5.6 Luna في النتائج الكاملة)، وطابقه L3 حرفًا بحرف.

النص الأصلي

تأتي اللغه (مقطع خاطئ) العربييي (مقطع خاطئ) ف (مقطع خاطئ) الوكز (مقطع خاطئ) الامس (مقطع خاطئ) كاكثر (مقطع خاطئ) اللغاة (مقطع خاطئ) تحدثن (مقطع خاطئ) في لعالم (مقطع خاطئ)

المرجع

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)

L3
مطابق

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)

Claude Fable 5.1
جزئي

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)

Claude Opus 5
جزئي

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)

GPT-6 Astra
جزئي

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)

GPT-5.6 Sol
جزئي

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)

Gemini 3.1 Pro
مطابق

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) المركز (تصحيح) الخامس (تصحيح) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح). (تصحيح)

DeepSeek V4 Pro
جزئي

تأتي اللغة (تصحيح) العربية (تصحيح) في (تصحيح) الوقت (يختلف عن المرجع) الحالي (يختلف عن المرجع) كأكثر (تصحيح) اللغات (تصحيح) تحدثا (تصحيح) في العالم (تصحيح)

لماذا المرجع صحيح

النص الأصلي جملة كثيرة الأخطاء الطباعية، ومعناها أن اللغة العربية تأتي في المركز الخامس بين أكثر اللغات تحدثًا في العالم: كلمات عدة أُسقطت منها حروف، أو تكررت فيها حروف، أو نقصتها همزة، أو أخطأت في نهاياتها؛ ويعيد المرجع كل كلمة إلى رسمها الصحيح ويضيف نقطة ختامية.

  • الإملاء
  • الترقيم
مثال 6

أخطاء صريحة، مع تعديل تحريري واحد

يتضمن تغييرًا تحريريًا

ستة تصويبات في جملة واحدة، أحدها تحريري؛ صحح GPT-6 Astra كل الأخطاء الصريحة ولم يختلف عن المرجع إلا في اصطلاح الفعل المبني للمجهول.

النص الأصلي

تحدث ايلون مسك (مقطع خاطئ) مع المشاركون (مقطع خاطئ) في مؤتمر الإقتصاد (مقطع خاطئ) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاث (مقطع خاطئ) وثلاثين مليار (مقطع خاطئ).

المرجع

تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وأعلنت (تصحيح) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).

L3
مطابق بعد التطبيع

تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وأُعْلِنت (يختلف عن المرجع في التشكيل أو الرسم فقط) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين ملياراً. (يختلف عن المرجع في التشكيل أو الرسم فقط)

Claude Fable 5.1
جزئي

تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).

Claude Opus 5
جزئي

تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).

GPT-6 Astra
جزئي

تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).

GPT-5.6 Sol
جزئي

تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليار (مقطع خاطئ).

Gemini 3.1 Pro
جزئي

تحدث إيلون مسك (يختلف عن المرجع) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليارا (تصحيح).

DeepSeek V4 Pro
جزئي

تحدث إيلون ماسك (تصحيح) مع المشاركين (تصحيح) في مؤتمر الاقتصاد (تصحيح) العالمي وتم إعلان (مقطع خاطئ) استثمارات بقيمة ثلاثة (تصحيح) وثلاثين مليار (مقطع خاطئ).

لماذا المرجع صحيح

تجمع جملة قصيرة واحدة ستة تصويبات: يُكتب اسم إيلون ماسك بالرسم المعياري، ويأخذ الاسم بعد حرف الجر «مع» علامة الجر (الياء والنون لا الواو والنون)، وتبدأ كلمة «الاقتصاد» بألف وصل من غير همزة لأن حركتها الأولى تسقط في الدرج، ويأتي العدد «ثلاثة» بصيغة المؤنث لأن الأعداد من ثلاثة إلى عشرة تخالف المعدود في الجنس، ويُنصب المعدود «مليارًا» تمييزًا بعد العدد المركب، ويفضّل المحرر أيضًا الفعل المبني للمجهول المباشر على تركيب «تم» مع المصدر.

  • الإملاء (اسم علم)
  • الإعراب
  • الإملاء (همزة الوصل)
  • مطابقة العدد للمعدود
  • نصب التمييز
  • معيار تحريري (فعل بدل «تم» والمصدر)
مثال 7

معيار تحريري

معيار تحريري لا خطأ: يفضّل المرجع صيغة المبني للمجهول المباشرة على «تم» مع المصدر، وأبقت النماذج التركيب كما هو التزامًا بتعليمات عدم إعادة الصياغة.

النص الأصلي

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

المرجع

بني (تصحيح) هذا النموذج عام 2024.

L3
مطابق بعد التطبيع

بُنِي (يختلف عن المرجع في التشكيل أو الرسم فقط) هذا النموذج عام 2024.

Claude Fable 5.1
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

Claude Opus 5
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

GPT-6 Astra
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

GPT-5.6 Sol
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

Gemini 3.1 Pro
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج عام 2024.

DeepSeek V4 Pro
دون تغيير

تم بناء (مقطع خاطئ) هذا النموذج في عام 2024.

لماذا المرجع صحيح

«تم بناء هذا النموذج» تركيب سليم نحويًا، لكن الأسلوب التحريري المعتمد يفضّل المبني للمجهول المباشر «بُني هذا النموذج»؛ وقد منعت التعليمات النماذج من إعادة الصياغة، فهذا اصطلاح أسلوبي يطبّقه المرجع لا خطأ صريح.

  • معيار تحريري
مثال 8

معيار تحريري

معيار تحريري: يوصي كثير من أدلة الأسلوب العربية بفعل آخر بمعنى «اعتبر»؛ الجملة الأصلية سليمة، وطُلب من النماذج ألا تعيد الصياغة.

النص الأصلي

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

المرجع

لطالما عد (تصحيح) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

L3
مطابق

لطالما عد (تصحيح) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

Claude Fable 5.1
دون تغيير

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

Claude Opus 5
دون تغيير

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

GPT-6 Astra
دون تغيير

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

GPT-5.6 Sol
دون تغيير

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنًا أخويًا، كما يرى مواطنو الكويت الإمارات امتدادًا طبيعيًا لأنفسهم.

Gemini 3.1 Pro
دون تغيير

طالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطنا أخويا، كما يرى مواطنو الكويت الإمارات امتدادا طبيعيا لأنفسهم.

DeepSeek V4 Pro
دون تغيير

لطالما اعتبر (مقطع خاطئ) مواطنو الإمارات الكويت وطناً أخوياً، كما يرى مواطنو الكويت الإمارات امتداداً طبيعياً لأنفسهم.

لماذا المرجع صحيح

يرى كثير من أدلة الأسلوب العربية أن «اعتبر» تعني بدقة «اتّعظ» أو «أخذ العبرة»، وتوصي بالفعل «عدّ» بمعنى «رأى» أو «حسب»؛ والجملة الأصلية سليمة، وقد منعت التعليمات النماذج من إعادة الصياغة، فهذا اصطلاح تحريري لا خطأ.

  • معيار تحريري

يحلّ L3 ثانيًا في معدل المعالجة، بعد Qwen 3.8 27B على Groq

رموز المخرج المصحح الموحدة في الثانية. الأعلى أفضل. زمن الطلب الفعلي من طرف إلى طرف، والمجزّئ نفسه لكل الأنظمة.

معدل معالجة خدمة التصحيح شاملًا عبء الطلب ومعالجة التعليمات، لا معدل فك الترميز الخام. Qwen 3.8 27B على Groq أسرع من L3 ويعرضه المخطط في المرتبة الأولى. عشرة إعدادات معروضة؛ ويسرد الجدول كلها من دون إجمالي الثواني.

السرعة

عالج L3 52.28 رمزًا موحدًا من المخرج في الثانية، بمعدل 1.041 ثانية للجملة المقيسة زمنيًا. وحلّ ثانيًا. فقد كان Qwen 3.8 27B على Groq أسرع، بمعدل 66.98 رمزًا في الثانية و0.828 ثانية للجملة، وهو يحتل الصف الأول من المخطط. وجاء Claude Haiku 4.5 ثالثًا بمعدل 33.43. أما Claude Fable 5.1، أقوى النماذج في الجودة، فعمل بمعدل 15.07 رمزًا في الثانية و3.585 ثانية للجملة. مقيس.

معدل المعالجة هنا هو معدل الخدمة. فلكل مخرج مصحح صالح، طبّقنا مجزّئ Lisan، وجمعنا عدد الرموز الموحدة، وقسمناه على زمن الطلب الفعلي من طرف إلى طرف، فيشمل الرقم عبء الطلب ومعالجة التعليمات لكل الأنظمة على السواء. وهو ليس سرعة فك الترميز، وليس المعدل المشبع بالدفعات المستخدم في قياس الطاقة أدناه؛ فالرقمان يصفان ظرفي تشغيل مختلفين ولا ينبغي مقارنتهما.

ولا يسير معدل المعالجة والجودة معًا بين الأنظمة المقارَنة. فقد حلّ Qwen 3.8 27B على Groq، أسرع الإعدادات، أخيرًا في مقياس التداخل المجموعي القديم بنسبة 75.81%. وعلى الطرف الآخر، بلغ متوسط Gemini 3 Flash 22.399 ثانية للجملة.

تقدير الطاقة للمنظومة الكاملة لـ L3 أقل من القيم المرجعية المستشهد بها للنماذج اللغوية الكبيرة بنحو 29 إلى 3,357 مرة

كيلوواط ساعة لكل 1,000 رمز معالج، مقياس لوغاريتمي: كل خط شبكة عشرة أضعاف سابقه. الأقل أفضل. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها.

رقم L3 على نطاق المسرّع قياس مباشر على NVIDIA A10؛ ورقم المنظومة الكاملة يطبّق معامل عبء بثلاثة أضعاف. أما القيم المرجعية فقيم منشورة أو مشتقة لمنظومة الخدمة الكاملة، وهي تقديرات مستشهد بها لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية. الشريط المظلل في صف L3 هو نطاق الحساسية من ضعفين إلى أربعة أضعاف.

الطاقة

قسنا L3 مباشرة على مسرّع NVIDIA A10 بسعة 24 غيغابايت: نسبة استغلال للمسرّع لا تقل عن 95%، وإحماء لمدة 30 ثانية، وحالة مستقرة لمدة 10 دقائق، وأخذ عينات القدرة بتردد 1 هرتز. وبلغ متوسط قدرة وحدة معالجة الرسوميات نحو 100 واط عند نحو 2,000 رمز في الثانية، أي 0.05 جول للرمز، أو نحو 0.000014 كيلوواط ساعة لكل 1,000 رمز. مقيس، على نطاق المسرّع.

يستثني هذا الرقم طاقة المضيف والتبريد والشبكات والتخزين وعبء المنشأة. ولمقارنة المثل بالمثل نضربه في ثلاثة، وهو معامل يقرّب حاصل ضرب 1.5 لفعالية استخدام الطاقة في 1.3 للتكرار والموثوقية في 1.5 لما تبقى من أعباء الخدمة والشبكة الكهربائية، فينتج تقدير للمنظومة الكاملة قدره 0.000042 كيلوواط ساعة لكل 1,000 رمز.

الطاقة لكل 1,000 رمز معالج، وهي القيم المرسومة أعلاه. عمود الواط ساعة هو قيمة الكيلوواط ساعة مضروبة في 1,000 لتُقرأ الأرقام دون أصفار بادئة. L3 مقيس؛ والقيم المرجعية تقديرات مستشهد بها لا قياسات للنماذج المختبرة.
النظامكيلوواط ساعة لكل 1,000 رمزواط ساعة لكل 1,000 رمزنسبةً إلى خط الأساسالدليل والنطاق
L30.0000140.014قبل معامل الثلاثة أضعافقياس مباشر على NVIDIA A10 بسعة 24 غيغابايت، نطاق المسرّع
L30.0000420.0421x، خط الأساستطبيع للمنظومة الكاملة بثلاثة أضعاف، خط الأساس للمقارنة
Gemini Apps0.00121.228.6xإفصاح Google عن منظومة الخدمة الكاملة، مستشهد به
GPT-4o-mini0.00616.1145.2xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 medium0.074741,761.9xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به
GPT-5 high0.1411413,357.1xتقدير IFP School، محوّل خطيًا ومطبّع، مستشهد به

أما أرقام النماذج اللغوية الكبيرة فتقديرات مستشهد بها لا قياسات، لأن مزودي الواجهات البرمجية لا يتيحون قياسات للطاقة. فإفصاح Google عن 0.24 واط ساعة لطلب نصي وسيط في Gemini Apps، بافتراض 200 رمز، يعطي 0.0012 كيلوواط ساعة لكل 1,000 رمز، وهو رقم للمنظومة الكاملة أصلًا. وقيم IFP School لكل استعلام، وهي 0.61 واط ساعة لـ GPT-4o-mini و7.4 واط ساعة لـ GPT-5 medium و14.1 واط ساعة لـ GPT-5 high عند 300 رمز، بعد تحويلها خطيًا إلى مقياس 1,000 رمز وضربها في معامل الثلاثة أضعاف نفسه، تعطي 0.0061 و0.074 و0.141 كيلوواط ساعة. وعلى هذا الأساس يقل تقدير المنظومة الكاملة لـ L3 عن القيم المرجعية بنحو 29 إلى 3,357 مرة. وقد رُبطت النماذج المختبرة التي لا رقم منشورًا لها بهذه القيم المرجعية بحسب فئة القدرة على سبيل التقدير الافتراضي؛ وذلك الربط مقارنة، لا قياس لأي نموذج بعينه.

والنتيجة حساسة لمعامل العبء، ولذلك نعرض النطاق لا نقطة الوسط وحدها. فعند الضعفين يكون تقدير L3 هو 0.000028 كيلوواط ساعة، ويكون التفوق على أكثر القيم المرجعية تحفظًا، وهو Gemini Apps، 42.9 مرة. وعند أربعة أضعاف يكون 0.000056 كيلوواط ساعة و21.4 مرة. وعبر هذا النطاق كله يظل L3 أكفأ في الطاقة من أدنى القيم المرجعية بما لا يقل عن 21 مرة. ومقارنة Gemini Apps هي التي ندافع عنها أولًا، لأنها تستند إلى إفصاح من المزود نفسه لا إلى تقدير طرف ثالث.

حساسية تقدير المنظومة الكاملة لـ L3 لمعامل العبء. Gemini Apps أدنى القيم المرجعية المستشهد بها وGPT-5 high أعلاها؛ وأيًّا كان المعامل المختار بين الضعفين وأربعة الأضعاف، يظل L3 أقل من أدنى قيمة مرجعية بما لا يقل عن 21 مرة.
معامل العبءكيلوواط ساعة لكل 1,000 رمز لـ L3التفوق على Gemini Apps (0.0012)التفوق على GPT-5 high (0.141)
2x0.00002842.9x5,036x
3x، المعتمد في التقرير0.00004228.6x3,357x
4x0.00005621.4x2,518x
كيف قيس رقم L3 على نطاق المسرّع، وفق منهجية الطاقة في التقرير.
القياسالقيمة
المسرّع المرجعيNVIDIA A10 بسعة 24 غيغابايت
نسبة الاستغلال في الحالة المستقرةلا تقل عن 95%
الإحماء ونافذة القياسإحماء لمدة 30 ثانية، ثم حالة مستقرة لمدة 10 دقائق
أخذ عينات القدرةبتردد 1 هرتز خلال نافذة الحالة المستقرة
متوسط قدرة وحدة معالجة الرسومياتنحو 100 واط
معدل المعالجة المستدامنحو 2,000 رمز في الثانية، بدفعات مشبعة
الطاقة لكل رمز0.05 جول
الطاقة لكل 1,000 رمز50 جول = 0.01389 واط ساعة = 0.0000139 كيلوواط ساعة، ويرد في التقرير بصيغة 0.000014
معامل المنظومة الكاملة3x، وهو تقريب لحاصل 1.5 (فعالية استخدام الطاقة) × 1.3 (التكرار والموثوقية) × 1.5 (ما تبقى من أعباء الخدمة والشبكة الكهربائية)
المستثنى من نطاق المسرّعطاقة المضيف والتبريد والشبكات والتخزين وعبء المنشأة

المنهجية

  1. بناء المعيار

    جُزّئت المادة المصدرية بمجزّئ الجمل المستخدم في المحرك. وراجع خبير لغوي كل جملة، فإما كتب مرجعًا مصححًا، وإما أبقى النص الأصلي كما هو حين لم يلزم تعديل. والنتيجة معيار من جمل عربية حقيقية راجعها خبير لغوي، في أزواج من نص أصلي ومرجع. وبعض الصفوف لا تحمل أي تعديل مرجعي، فيُقاس كل نظام أيضًا على تركه النص الصحيح دون مساس.

  2. التعليمات

    تلقّى كل نموذج لغوي كبير التعليمات العربية ذاتها المكونة من أربعة أسطر، حرفيًا:

    صحح الأخطاء في كل جملة من الجمل التالية إن وجدت.

    لا تعد صياغة الجملة أو تحذف من كلماتها فقط صحح الأخطاء الإملائية أو القواعدية بها.

    لا تضف التشكيل إلى الكلمات.

    إذا لم تجد خطأ، أعد الجملة نفسها تماماً.

    قيّدت التعليمات النموذج بالتصحيح الإملائي والنحوي، ومنعت إعادة الصياغة وحذف الكلمات، ومنعت إضافة التشكيل، واشترطت إعادة الجملة الأصلية كما هي عند عدم وجود خطأ.

  3. المخرج الواحد

    مخرج نهائي واحد مقيّم لكل صف ولكل إعداد. ولم تُستخدم إعادة المحاولة عند أعطال النقل أو التحقق إلا للحصول على استجابة صالحة، لا لحساب متوسط عدة توليدات أو اختيار أفضلها. ولم يُستخدم من L3 إلا التصحيح الأول المقترح، ليطابق مخرجه القيد المفروض على النماذج.

  4. توحيد المخرجات

    أعادت بعض النماذج تعليقات أو تصريحًا بأن النص صحيح أصلًا. وحددت سلسلة الإعداد هذه الأغلفة وأعادتها إلى الجملة الأصلية حيث لزم، حتى لا تُقيَّم التعليقات تعديلات عربية. ولكل إعداد مخرج نهائي غير فارغ لكل صف؛ ولم يُستبعد أي صف.

  5. تقييم المقاطع بحدودها الدقيقة

    مقيّم ProofreadingEvaluator المكتوب بلغة Java مدعومًا بـ ArabicWordTokenizer وTextCorrectionExtractor. تُجزّأ الجملة الأصلية والمرجع والمخرج؛ وتُستخرج التعديلات المرجعية (من الأصل إلى المرجع) وتعديلات النظام (من الأصل إلى المخرج)؛ ويُمثَّل كل تعديل بفاصلته الدقيقة في النص الأصلي، والإضافات مواضع صفرية العرض؛ وتُطابَق تعديلات النظام والمرجع بتطابق الحدود في النص الأصلي من غير اشتراط تطابق نوع العملية؛ وتُجمَع حالات الرصد الصحيح والإنذار الكاذب والفائت عبر كل الجمل قبل حساب المقاييس (متوسط جزئي). حيث TP حالات الرصد الصحيح، وFP الإنذارات الكاذبة، وFN التعديلات الفائتة: Precision = TP / (TP + FP)، Recall = TP / (TP + FN)، F1 = 2PR / (P + R)، F0.5 = 1.25PR / (0.25P + R). ولا تُحسب الحالات السلبية الصحيحة، لأن عدد المقاطع غير الخاطئة الممكنة غير محدد جيدًا. ووحدة التقييم مقطع مستخرج من النص الأصلي، لا حرف متغير.

  6. دقة التصحيح

    تُقاس فقط على حالات الرصد الصحيح. الحرفية تعني تطابق البديل مع بديل المرجع حرفًا بحرف. وبعد التطبيع تُقارَن الصورتان بعد تطبيع عربي يزيل التشكيل والتطويل ويوحّد صور الألف والهمزة والتاء المربوطة.

  7. التطابق التام للجملة

    نسبة الصفوف التي يطابق مخرجها الكامل المرجع الكامل تمامًا.

  8. ROUGE

    يُزال التشكيل والتطويل، ويُجزّأ النصان بـ ArabicWordTokenizer. يستخدم ROUGE-1 تداخل الكلمات المفردة بعدّ التكرار؛ ويستخدم ROUGE-L أطول متتابعة رموز مشتركة مع حفظ الترتيب. الدقة والاستدعاء وF1 لكل جملة، بمتوسط كلي.

  9. التداخل المجموعي القديم

    الرموز المشتركة الفريدة على أطوال قائمتي الرموز كاملتين، بمتوسط كلي لكل جملة. محتفظ به للتتبع، لا مقياسًا رئيسيًا للدقة.

  10. معدل المعالجة

    لكل مخرج مصحح صالح، يُطبَّق مجزّئ Lisan ويُقسَم عدد الرموز الموحدة المتراكم على زمن الطلب الفعلي من طرف إلى طرف. وهذا معدل معالجة خدمة النص المصحح، ويشمل عبء الطلب ومعالجة التعليمات. وصفّ Qwen 3.8 27B مقيس على عتاد Groq.

  11. الطاقة

    كيلوواط ساعة لكل 1,000 رمز معالج. قِيس L3 على NVIDIA A10 بسعة 24 غيغابايت في الظروف المذكورة في قسم الطاقة؛ ومعامل المنظومة الكاملة ثلاثة أضعاف؛ والقيم المرجعية من إفصاح Google عن Gemini Apps ومن قيم IFP School لكل استعلام محوَّلة إلى مقياس 1,000 رمز؛ وربط بحسب الفئة للنماذج التي لا رقم منشورًا لها؛ وحساسية من ضعفين إلى أربعة أضعاف من العبء.

  12. درجات المنافسين

    أُنتج كل رقم للنماذج اللغوية الكبيرة من تشغيل فريق البحث في Lisan لخدمة المزود، مع الاستضافة كما وردت في القائمة. ولم يؤخذ أي رقم من نتائج منشورة لدى المزود.

الأنظمة الخاضعة للاختبار

يضم ميدان المقارنة 26 إعدادًا من النماذج اللغوية الكبيرة من ستة مزودين، إلى جانب L3. وشُغّل GPT-6 Astra بإعدادي استدلال، ولا تحمل ملاحق التقرير إلا صفًا واحدًا له. وفيما يلي التجميع كما ورد في التقرير:

  • Lisan: L3، محرك Lisan اللغوي، مقيّمًا على اقتراحه الأول فقط.
  • Anthropic: Claude Opus 5، Claude Sonnet 5، Claude Haiku 4.5، Claude Fable 5.1.
  • OpenAI: GPT-6 Astra، GPT-5.6 Sol، GPT-5.6 Terra، GPT-5.6 Luna، GPT-5.1 (medium reasoning)، GPT-5.4 (high reasoning)، GPT-4o-mini، gpt-oss-120b (على Groq).
  • Google: Gemini 2.5 Flash، Gemini 3.1 Pro (إصدار معاينة)، Gemini 3.5 Flash-Lite، Gemini 3.8 Flash، Gemini 3 Flash (إصدار معاينة)، Gemma 3 27B (على Bedrock).
  • DeepSeek: DeepSeek V4 Flash، DeepSeek V4 Pro.
  • Meta: Llama 3.1 70B (على BedrockLlama 3.3 70B، Llama 4 Maverick.
  • Alibaba Qwen: Qwen 3.6 27B وQwen 3.8 27B، كلاهما على Groq.

تلقّى كل إعداد الجمل نفسها، والتعليمات نفسها، وقاعدة المخرج الواحد نفسها، والمقيّم نفسه.

الأدلة

الادعاءالنطاقالحالة
80.29% على F0.5 للتعديلات، الأول بين كل الإعداداترصد المقاطع بحدودها الدقيقة، متوسط جزئي، مخرج واحد لكل نظاممقيس
دقة 84.54% واستدعاء 66.85%؛ النظام الوحيد فوق 80% و60% معًاالبروتوكول نفسهمقيس
دقة تصحيح 89.79% حرفيًا و96.38% بعد التطبيعمشروطة برصد صحيحمقيس
تطابق تام للجملة 55.96%، ضعف نسبة Claude Fable 5.1 البالغة 27.98%لكل صف، صارم، حرفًا بحرفمقيس
98.84% على ROUGE-1 F1 و98.83% على ROUGE-L F1متوسط كلي لكل جملة بعد التطبيعمقيس
52.28 رمزًا في الثانية، الثاني بعد Qwen 3.8 27B على Groq بمعدل 66.98معدل الخدمة شاملًا عبء الطلبمقيس
0.000014 كيلوواط ساعة لكل 1,000 رمزNVIDIA A10، دفعات مشبعة، نطاق المسرّعمقيس
0.000042 كيلوواط ساعة لكل 1,000 رمز للمنظومة الكاملة، أقل من القيم المرجعية بنحو 29 إلى 3,357 مرةمعامل ثلاثة أضعاف؛ القيم المرجعية تقديرات مستشهد بها لا قياسات للنماذج المختبرةمقيس لـ L3، تقديرات مستشهد بها للقيم المرجعية
كل تصحيح مصحوب بشرح؛ ويُنشر المحرك داخل مقر المؤسسةمنتج WriteXإمكانية في المنتج

القيود

  • منعت التعليمات إعادة الصياغة، فالصفوف التي يطبّق فيها المرجع اصطلاحًا تحريريًا تميل لصالح المعيار الذي التزمه الخبير اللغوي. تُظهر تلك الصفوف تطبيق L3 لذلك المعيار، لا إخفاق النماذج في النحو. وثمة صفان آخران يخصان قاعدتين معياريتين في اختيار حرف الجر، والاستعمال الذي تخطّئانه شائع في العربية المعاصرة؛ يعدّه المرجع خطأ، وقد يخالفه قارئ متأنٍّ.
  • القيم المرجعية للطاقة تقديرات مستشهد بها، لا قياسات للنماذج المختبرة عبر واجهاتها البرمجية. ومعامل المنظومة الكاملة بثلاثة أضعاف اختيار التقرير، وقد رُبطت النماذج التي لا رقم منشورًا لها بقيمة مرجعية بحسب فئة القدرة على سبيل التقدير الافتراضي.
  • يشمل معدل المعالجة عبء الطلب ومعالجة التعليمات، ويعكس منظومة الخدمة لدى كل مزود وقت التشغيل، لا النموذج منفردًا.
  • هذه لقطة معيار واحدة بتاريخ 9 سبتمبر 2026، بمرجع واحد من خبير لغوي لكل جملة ومخرج واحد لكل نظام. وتتغير واجهات النماذج؛ فالأرقام تصف تلك اللقطة.
  • صمم فريق البحث في Lisan التقييم ونفّذه. ولم يُتحقق منه بصورة مستقلة. والتعريفات والتعليمات الحرفية وكل النسب منشورة كاملة ليتسنى تكرار البروتوكول على مادة أخرى؛ أما جمل المعيار نفسها فمتاحة للباحثين عند الطلب.
  • L3 ليس كاملًا. فقد فاتته تعديلات مرجعية، واقترح تغييرات لم يُجرِها الخبير اللغوي؛ وتصف دقة 84.54% واستدعاء 66.85% الجانبين.
  • الإصدار 1.0 من التقرير. وستُوثَّق التصويبات واللقطات اللاحقة بإصدارات على هذه الصفحة.

النتائج الكاملة

النتائج الكاملة، تاريخ التقييم 9 سبتمبر 2026 · الإصدار 1.0. نسب فقط؛ لا تُنشر أعداد المقاطع ولا إجمالي الثواني. انظر المنهجية.

الملحق أ: نتائج المقاطع بحدودها الدقيقة، كل الإعدادات
كل الصفوف بترتيب F0.5. نسب فقط. الأفضل في العمود
الترتيبالنظامملاحظاتالدقةالاستدعاءF1F0.5التصحيح الحرفيالتصحيح بعد التطبيعالتطابق التام للجملة
1L3مخرج واحد، الاقتراح الأول فقط84.54 (الأفضل في العمود)66.85 (الأفضل في العمود)74.66 (الأفضل في العمود)80.29 (الأفضل في العمود)89.79 (الأفضل في العمود)96.38 (الأفضل في العمود)55.96 (الأفضل في العمود)
2Claude Fable 5.1مخرج واحد64.2120.1530.6844.6889.0794.5427.98
3Claude Opus 5مخرج واحد39.1930.9534.5837.2186.1290.3921.65
4Gemini 3.5 Flash-Liteمخرج واحد43.3921.7028.9336.1681.7389.3424.33
5Gemini 3.8 Flashمخرج واحد33.8730.1831.9233.0684.6791.9716.55
6GPT-5.6 Terraمخرج واحد32.5632.6032.5832.5785.4789.5318.49
7Gemini 3.1 Proمخرج واحد، إصدار معاينة33.1228.9630.9032.2087.4591.2515.82
8GPT-6 Astraمخرج واحد31.3534.8032.9931.9885.7691.4618.98
9Gemini 3 Flashمخرج واحد، إصدار معاينة31.0535.0232.9231.7783.6591.1919.22
10Gemini 2.5 Flashمخرج واحد34.6523.2427.8231.5577.7389.5718.49
11DeepSeek V4 Proمخرج واحد31.6028.0829.7430.8385.8890.9816.30
12GPT-5.6 Lunaمخرج واحد28.2836.7831.9829.6586.5390.7215.57
13Claude Sonnet 5مخرج واحد29.6626.1027.7728.8781.8687.7615.82
14DeepSeek V4 Flashمخرج واحد28.3031.1729.6628.8374.9185.5115.33
15GPT-5.1 (medium reasoning)مخرج واحد26.6138.3331.4128.3483.0587.937.06
16GPT-5.6 Solمخرج واحد25.0341.0831.1127.1582.8487.4010.95
17GPT-5.4 (high reasoning)مخرج واحد24.4037.2229.4826.2184.0288.467.54
18Qwen 3.6 27B on Groqمخرج واحد، على Groq24.3124.3424.3324.3276.9280.5412.65
19GPT-4o-miniمخرج واحد23.1326.8724.8623.7976.6482.389.73
20Gemma 3 27Bمخرج واحد، على Bedrock21.8135.0226.8823.5969.1881.765.84
21Qwen 3.8 27B on Groqمخرج واحد، على Groq23.4522.4722.9523.2572.5582.3516.06
22gpt-oss-120bمخرج واحد، على Groq21.7426.4323.8622.5472.0877.508.76
23Claude Haiku 4.5مخرج واحد20.5727.2023.4221.6276.5280.167.54
24Llama 4 Maverickمخرج واحد17.1033.0422.5418.9373.6778.672.68
25Llama 3.1 70Bمخرج واحد، على Bedrock16.5722.9119.2317.5475.4880.297.06
26Llama 3.3 70Bمخرج واحد11.2727.4215.9712.7767.4772.691.70
الملحق ب: ROUGE، كل الإعدادات
مرتبة بحسب ROUGE-1 F1. الأفضل في العمود
الترتيبالنظامROUGE-1 PROUGE-1 RROUGE-1 F1ROUGE-L PROUGE-L RROUGE-L F1
1L398.98 (الأفضل في العمود)98.70 (الأفضل في العمود)98.84 (الأفضل في العمود)98.97 (الأفضل في العمود)98.70 (الأفضل في العمود)98.83 (الأفضل في العمود)
2Claude Fable 5.196.7996.3896.5696.7696.3596.54
3Gemini 3.1 Pro96.6296.3596.4796.6096.3396.45
4Gemini 3 Flash96.5196.3796.4296.4796.3396.38
5Gemini 3.8 Flash96.5296.3296.4196.4996.3096.38
6GPT-6 Astra96.5196.3296.4096.4796.2896.36
7Gemini 3.5 Flash-Lite96.5896.1096.3296.5596.0896.30
8Gemini 2.5 Flash96.4596.1196.2796.4296.0896.24
9Claude Opus 595.9896.0495.9995.9395.9995.94
10GPT-5.6 Terra95.8895.8595.8595.8195.7795.77
11GPT-5.6 Luna95.8495.8095.8095.7995.7695.76
12DeepSeek V4 Flash95.6595.6895.6595.6195.6495.61
13DeepSeek V4 Pro95.5495.3995.4495.4795.3195.37
14GPT-5.6 Sol95.2495.4995.3495.1695.4195.26
15GPT-5.1 (medium reasoning)95.5095.2295.3495.4095.1295.24
16Claude Sonnet 595.3095.0795.1795.2495.0295.11
17GPT-5.4 (high reasoning)94.9595.1695.0394.8995.1094.98
18Qwen 3.8 27B on Groq95.1794.8694.9995.0994.7994.92
19Qwen 3.6 27B on Groq94.9394.5294.7094.8994.4894.66
20GPT-4o-mini95.0094.2194.5894.9394.1394.50
21Gemma 3 27B94.3793.7294.0194.2493.6093.89
22gpt-oss-120b94.2193.7593.9694.1393.6793.87
23Claude Haiku 4.594.1793.5193.8194.1393.4893.78
24Llama 3.1 70B94.4793.0893.7294.3092.9193.55
25Llama 4 Maverick93.8992.3593.0793.7992.2592.96
26Llama 3.3 70B93.1089.3091.0792.9689.1690.93
الملحق ج: التداخل المجموعي القديم، كل الإعدادات
محتفظ به للتتبع، لا مقياسًا رئيسيًا. الأفضل في العمود
الترتيبالنظامالدقة المجموعيةالاستدعاء المجموعيF1 المجموعي
1L391.47 (الأفضل في العمود)91.44 (الأفضل في العمود)91.45 (الأفضل في العمود)
2Claude Fable 5.189.0088.8988.93
3Gemini 3.1 Pro88.8588.8688.84
4Gemini 3.8 Flash88.7688.8288.78
5Gemini 3 Flash88.7388.8388.77
6GPT-6 Astra88.6688.7988.71
7Gemini 2.5 Flash88.7388.6388.67
8Gemini 3.5 Flash-Lite88.5788.6188.58
9Claude Opus 588.0888.3488.20
10GPT-5.6 Luna87.9688.1088.02
11GPT-5.6 Terra87.9588.0587.99
12DeepSeek V4 Flash87.6187.8087.64
13Claude Sonnet 587.5287.5487.52
14GPT-5.6 Sol87.3887.5487.45
15DeepSeek V4 Pro87.0887.8287.33
16GPT-5.1 (medium reasoning)87.2787.3487.29
17GPT-5.4 (high reasoning)87.1387.2787.19
18GPT-4o-mini86.4786.5886.50
19Qwen 3.6 27B on Groq86.4386.7986.42
20Gemma 3 27B86.2186.1386.14
21gpt-oss-120b85.9586.0886.00
22Claude Haiku 4.585.9286.1285.99
23Llama 3.1 70B84.9285.1184.96
24Llama 4 Maverick84.4184.7284.54
25Llama 3.3 70B80.6081.3080.92
26Qwen 3.8 27B on Groq74.9677.8875.81
الملحق د: معدل المعالجة، كل الإعدادات
الترتيب بحسب الرموز في الثانية؛ ويحتفظ Qwen 3.6 27B على Groq وClaude Opus 5 بترتيب التقرير. ولا يُنشر إجمالي الثواني. الأفضل في العمود
الترتيبالنظامرموز في الثانيةمللي ثانية للرمزثوانٍ للجملة
1Qwen 3.8 27B on Groq66.98 (الأفضل في العمود)14.931 (الأفضل في العمود)0.828 (الأفضل في العمود)
2L352.2819.1281.041
3Claude Haiku 4.533.4329.9151.619
4gpt-oss-120b26.4437.8182.022
5GPT-4o-mini23.2742.9792.319
6Llama 3.1 70B23.0043.4852.324
7GPT-5.4 (high reasoning)22.7343.9932.331
8GPT-5.1 (medium reasoning)21.6746.1422.432
9DeepSeek V4 Flash21.1647.2682.585
10DeepSeek V4 Pro20.7148.2942.580
11GPT-5.6 Terra16.2861.4173.353
12Gemini 2.5 Flash16.0562.2983.389
13Claude Fable 5.115.0766.3523.585
14Gemma 3 27B14.5668.6793.726
15GPT-5.6 Luna12.5879.4824.340
16Claude Sonnet 512.2981.3864.379
17GPT-5.6 Sol8.38119.3506.545
18Gemini 3.1 Pro8.05124.2346.762
19Qwen 3.6 27B on Groq7.90126.5618.558
20Claude Opus 57.43134.6697.221
21Gemini 3.8 Flash6.25159.9968.720
22Llama 3.3 70B5.98167.3348.785
23Llama 4 Maverick5.53180.7619.724
24GPT-6 Astra3.93254.39413.874
25Gemini 3.5 Flash-Lite2.91343.28318.663
26Gemini 3 Flash2.43410.77522.399

الاستشهاد بهذا التقرير

يُرجى الاستشهاد بالتقرير بعنوانه الأصلي، وهو يختلف عن عنوان هذه الصفحة (تبقى الصيغة بالإنجليزية لتوحيد الاستشهاد):

للاستشهاد بهذه الصفحة

Lisan Research (2026). Arabic Language Checking Evaluation: the Lisan Engine and 26 Large Language Model Configurations. Evaluation report, version 1.0, evaluation snapshot 9 September 2026. Lisan. https://lisan.com/company/research/l3/
BibTeX
@techreport{lisan2026l3,
  type = {Evaluation report},
  author = {Lisan Research},
  title = {Arabic Language Checking Evaluation: the Lisan Engine and 26 Large Language Model Configurations},
  institution = {Lisan},
  year = {2026},
  month = sep,
  number = {Version 1.0},
  note = {Evaluation snapshot 9 September 2026. Published 15 September 2026.},
  url = {https://lisan.com/company/research/l3/},
}

دقّق نصوصك بنفسك

المعيار معيارنا؛ أما وثائقك فهي الاختبار الذي يهم. محرر WriteX مجاني في البداية، ويمكن للمؤسسات تشغيل L3 على بنيتها التحتية ضمن مشروع تجريبي، وتُرسل أسئلة المنهجية إلى support@lisan.com.

أسئلة شائعة

لماذا F0.5 لا F1؟

لأن التغيير غير الضروري في التدقيق اللغوي يكلّف عادةً أكثر من التعديل الفائت: فلا بد من مراجعته ورفضه، وربما التراجع عنه يدويًا. ويرجّح F0.5 الدقة على الاستدعاء تعبيرًا عن ذلك. وننشر F1 والدقة والاستدعاء أيضًا، ويتصدر L3 المقاييس الأربعة كلها، فاختيار المقياس الرئيسي لا يغيّر الترتيب في القمة.

هل تُحقق من هذا التقييم بصورة مستقلة؟

لا. فقد صممه فريق البحث في Lisan ونفّذه. وما نقدّمه بدلًا من ذلك هو المنهجية كاملة: التعليمات الحرفية، وقاعدة المخرج الواحد، وتعريفات تقييم المقاطع بحدودها الدقيقة، وخطوات التطبيع، وكل نسبة في الملاحق. ويمكن لأي جهة تملك مجموعة عربية راجعها خبير لغوي أن تكرر البروتوكول، ومحرر WriteX متاح مجانًا لهذا الغرض.

لماذا تسجّل النماذج اللغوية الكبيرة استدعاءً منخفضًا؟

تظهر أسباب عدة في الصفوف. فالتقييم صارم: لا يحصل النموذج على نقطة إلا إذا غيّر المقطع الذي غيّره الخبير اللغوي بالضبط، وقد يُعدّ تغيير علامة الترقيم مقطعًا مستقلًا. ومنعت التعليمات إعادة الصياغة والتشكيل، فتُركت صفوف المعيار التحريري والقواعد الكلاسيكية، مثل مواضع الهمزة داخل المصطلحات التقنية الشائعة، في الغالب من غير مساس. وتختلف الملامح: غيّر Claude Fable 5.1 قليلًا وأصاب غالبًا، بينما غيّر GPT-5.6 Sol كثيرًا وأخطأ غالبًا. واستدعاء 20.15% و41.08% هما طرفا ذلك النطاق.

هل تعني نسبة 96.38% أن دقة L3 هي 96%؟

لا. فتلك النسبة مشروطة: من بين المقاطع التي حددها L3 تحديدًا صحيحًا، حمل 96.38% منها البديل الصحيح بعد التطبيع العربي. وكان استدعاؤه 66.85%، وتطابقه الصارم على مستوى الجملة كاملة 55.96%. فاقرأ الأرقام الثلاثة معًا.

على ماذا تستند مقارنة الطاقة؟

رقم L3 قياس مباشر على NVIDIA A10 مع تطبيق معامل منظومة كاملة بثلاثة أضعاف. أما أرقام النماذج اللغوية الكبيرة فقيم مرجعية مستشهد بها: إفصاح Google عن Gemini Apps وتقديرات IFP School لكل استعلام، محوَّلة إلى مقياس 1,000 رمز. وهي ليست قياسات للنماذج المختبرة عبر واجهاتها البرمجية، ونعرض نطاق الحساسية من ضعفين إلى أربعة أضعاف ليرى القارئ مقدار أثر المعامل.