أبحاث · تقرير تقييم · سبتمبر 2026

M3: تفريغ الاجتماعات العربية،
مقاسًا على اجتماعات حقيقية

سجّل M3، نظام تفريغ الاجتماعات العربية داخل MeetriX، معدل خطأ على مستوى الأحرف قدره 1.62% على اجتماعات عمل عربية حقيقية متعددة اللهجات لها نصوص مرجعية تحقق منها بشر، وهو الأدنى بين الأنظمة السبعة المقارنة. وجاء Google chirp_3 بعده عند 2.26%.

أبحاث

  • تاريخ النشر
  • الإصدارإصدار التقييم، سبتمبر 2026
  • إعدادLisan Research
1.62%معدل الخطأ على مستوى الأحرفمُقاس على الاجتماعات نفسها المتحقق منها بشريًا التي خضع لها كل نظام مقارن
28% إلى 83%معدل خطأ أدنى من كل نظام مقارنمُقاس، تقريبي، مقابل ست واجهات برمجية للتعرف على الكلام
نحو 45 ثانيةلتفريغ ساعة من الصوتبحسب تقرير الفريق، نحو 80 ضعف الزمن الحقيقي على معالج L4، معالجة دفعية لا مباشرة
7أنظمة قُيّمت على الصوت والمرجع والقواعد نفسهاM3 وست واجهات برمجية تجارية للتعرف على الكلام

لماذا تختلف الاجتماعات العربية؟

نادرًا ما يُعقد اجتماع عمل في المنطقة بمستوى لغوي واحد. قد يفتتح رئيس الاجتماع الحديث بالعربية الفصحى، ويجيب زميل بلهجة خليجية أو شامية، ثم تأتي المصطلحات التقنية وأسماء المنتجات والأرقام بالإنجليزية داخل الجملة العربية نفسها. وتحتوي الاجتماعات التي خضعت للتقييم على ذلك كله: لهجات عربية متعددة، ومصطلحات تقنية إنجليزية داخل الكلام العربي، وعدة مشاركين في التسجيل الواحد، وتداخل بين المتحدثين، وعبارات تقل مدتها عن ثانية، وفترات صمت، وجمل مقطوعة عند حدود المُسجِّل. نوعي.

كل حالة من هذه الحالات تُربك نظام التفريغ بطريقة مختلفة. فقد يُصنَّف رد قصير جدًا على أنه صمت فيُحذف. وقد تحل كلمة عربية قريبة في النطق محل اختصار إنجليزي. وقد تتحول وقفة إلى حشو مختلق، وقد يُضيّع حدٌّ صارم للمقطع الكلمات الأولى من مداخلة كاملة. ولا يكون سجل الاجتماع نافعًا إلا إذا نجت الأرقام والأسماء والقرارات من هذه الظروف، ولهذا أُجري التقييم على اجتماعات حقيقية لا على كلام مقروء.

يسجّل M3 أدنى معدل خطأ على مستوى الأحرف بين سبعة أنظمة على الاجتماعات نفسها المتحقق منها بشريًا

الأقل أفضل. معدل الخطأ على مستوى الأحرف (CER) بعد التطبيع المعجمي المحدد.

المصدر الصوتي نفسه، والنص المرجعي نفسه، وقواعد التقييم نفسها لكل نظام. تلقى كل نظام الصوت نفسه المفصول بحسب المشارك، فلا تدخل نسبة الكلام إلى المتحدثين في المقارنة. بيانات التقييم بتاريخ سبتمبر 2026. انظر فقرة «كيف قسنا» لقواعد التقييم.

مُقاس. يعرض الرسم معدل الخطأ على مستوى الأحرف للأنظمة السبعة على مجموعة التقييم نفسها المتحقق منها بشريًا، بعد التطبيع المعجمي الموصوف في فقرة «كيف قسنا». سجّل M3 نسبة 1.62%، يليه Google chirp_3 عند 2.26%. ويشكّل Cohere (4.93%) وElevenLabs Scribe (5.01%) وDeepgram Nova-3 (6.09%) مجموعة وسطى، ويختتم Google latest_long عند 9.01% وSonix عند 9.8% القائمة. وببساطة، معدل الخطأ على مستوى الأحرف هو نسبة الحروف التي لزم إضافتها أو حذفها أو تغييرها حتى يطابق النص ما تحقق البشر من أنه قيل فعلًا، فنسبة 1.62% تعني نحو 16 حرفًا خاطئًا في كل 1,000 حرف.

الفارق مع chirp_3 هو 0.64 نقطة مئوية، أي معدل خطأ أقل بنحو 28%. والفارق مع Sonix هو 8.18 نقطة، أي أقل بنحو 83%. وتأتي هذه الأرقام كلها من مجموعة تقييم واحدة، وتوضح فقرة «الحدود» ما يدعمه ذلك وما لا يدعمه.

جدول الترتيب

يحمل الجدول أدناه النتائج السبع نفسها مع الدقة على مستوى الأحرف (100 ناقص معدل الخطأ) والانخفاض النسبي التقريبي لـM3 مقابل كل نظام. اقرأ عمود الانخفاض بوصفه وصفًا للفارق على مجموعة التقييم هذه، لا ترتيبًا للمزودين حسب الجودة؛ فالفارق الأكبر مع نظام ما يقول عن إعداد ذلك النظام للعربية بقدر ما يقول عن M3.

معدل الخطأ على مستوى الأحرف والدقة على مستوى الأحرف للأنظمة السبعة، مع الانخفاض النسبي التقريبي لـM3 مقابل كل نظام. معدل الخطأ الأقل أفضل. مُقاس على الاجتماعات نفسها المتحقق منها بشريًا؛ قواعد التقييم في فقرة كيف قسنا. الأفضل في العمود
الترتيبالنظاممعدل الخطأ على مستوى الأحرف (%)، الأقل أفضلالدقة على مستوى الأحرف (%)M3 مقابل هذا النظام
1M31.62 (الأفضل في العمود)98.38 (الأفضل في العمود)الأساس
2Google chirp_32.2697.74أقل بنحو 28% (0.64 نقطة)
3Cohere4.9395.07أقل بنحو 67% (3.31 نقطة)
4ElevenLabs Scribe5.0194.99أقل بنحو 68% (3.39 نقطة)
5Deepgram Nova-36.0993.91أقل بنحو 73% (4.47 نقطة)
6Google latest_long9.0190.99أقل بنحو 82% (7.39 نقطة)
7Sonix9.890.2أقل بنحو 83% (8.18 نقطة) (الأفضل في العمود)

كيف تبدو النصوص المفرّغة؟

تخفي المعدلات الإجمالية ما يحدث فعلًا داخل النص المفرّغ. تعرض البطاقات أدناه النص المرجعي المتحقق منه بشريًا ومخرجات كل نظام لمقاطع مفردة، منقولة حرفيًا من التقييم. أسماء المتحدثين تسميات افتراضية بديلة عن الأسماء الحقيقية. وتحمل كل بطاقة المقطع الصوتي المصدر: مقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة. اخترنا مقاطع يستطيع القارئ الذي لا يعرف العربية فحصها أيضًا: خلية فارغة، أو مصطلح لاتيني، أو رقم، أو انتقال إلى كتابة أخرى، أمور مرئية بأي لغة. وحيثما أخطأ M3 نفسه، يقول التعليق ذلك صراحة. وبموجب قواعد التقييم لا يُعد الرسم الصوتي للمصطلح الإنجليزي خطأ، ولذلك تؤثر بعض الفروق أدناه في القابلية للقراءة والبحث لا في معدل الخطأ.

مثال 1المصطلحات الإنجليزية
  • المتحدث Kareem Saleh
  • المقطع 38faf0f4_6
  • مدة المقطع 42.66 ث
المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير بالنسبة لي امبارح كان معظم الشغل مع تيم العربي الجديد بخصوص الـ SDK (مصطلح محفوظ) اتسكر تقريبا مشكلتين و إلهن علاقة بالـ rendering (مصطلح محفوظ) الـ highlights (مصطلح محفوظ) بالإديتور اللي معمل له الـ Configuration (مصطلح محفوظ) من عندن بصفى مشكلة وحدة طلبنا منهم اجتماع مشان نكمل معهم اليوم ان شاء الله، كمان امبارح صرت اشتغل على موضوع الـ Chrome extension (مصطلح محفوظ) بين كوركتو و Lisan (مصطلح محفوظ) ما كثير يعني خلصت هذا الموضوع، اليوم ان شاء الله بدي كمل مثل ما قلت بخصوص العربي الجديد وكمان الـ Chrome extension مع كوركتو، يعطيكم العافية.

المرجع

صباح الخير، بالنسبة لي امبارح كان معظم الشغل مع تيم العربي الجديد بخصوص الـ SDK اتسكر تقريبا مشكلتين ولهم علاقة بالـ rendering للـ highlights بالـ editor اللي معمل له configuration من عندن بصفى مشكلة وحدة طلبنا منن اجتماع مشان نكمل معن اليوم ان شاء الله كمان امبارح صرت اشتغل على موضوع الـ Chrome extension بين كوركتا و Lisan ما كتير خلصت هذا الموضوع اليوم إن شاء الله بدي كمل متل ما قلت بخصوص العربي الجديد وكمان الـ (Chrome extension) مع العربي الجديد

لماذا يهم هذا المثال اجتماع متابعة يومي مليء بمفردات المطورين. يحتفظ M3 بمصطلحات SDK وrendering وhighlights وconfiguration وChrome extension وLisan بالحروف اللاتينية. ويحتفظ بها ElevenLabs Scribe أيضًا مع حشو كثيف. وchirp_3 كامل لكنه يكتبها صوتيًا، وهو ما تقبله قواعد التقييم؛ الفرق هو ما سيجده مربع البحث لاحقًا.

  • محفوظ: SDK, rendering, highlights, Configuration, Chrome extension, Lisan
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Sonix: محتوى ساقط
  • Cohere: محتوى ساقط
مثال 2الحشو والترقيم
  • المتحدث Rami Haddad
  • المقطع a3ef0ea8_735
  • مدة المقطع 20.81 ث
المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير يعطيكم العافية. آآآه (إدراج حشو) امبارح كان في عندنا متابعة باجتماعات الـ Sprint Planning (مصطلح محفوظ) آآه (إدراج حشو) كان في كمان متابعة مع آآه (إدراج حشو) الشي المطلوب من هيئة الزكاة والضرائب بالسعودية آآه (إدراج حشو) موضوع الـ آآه (إدراج حشو) الـ VAT (مصطلح محفوظ) ضريبة القيمة المضافة. كنت عم بتابع بهدول المواضيع يعطيكم العافية.

المرجع

صباح الخير يعطيكم العافية امبارح كان في عنا متابعة باجتماعات السبرنت بلاننج كان في كمان متابعة مع الشي المطلوب من هيئة الزكاة والضرائب بالسعودية موضوع ال الزاد ضريبة القيمة المضافة كان كنت عم بتابع بهدول المواضيع يعطيكم العافية

لماذا يهم هذا المثال تحديث حالة يكثر فيه تردد المتحدث. يحتفظ M3 بمصطلحي Sprint Planning وVAT بالحروف اللاتينية مع الشرح العربي لـ VAT، بينما يطبع Cohere خمس علامات تردد، وتشوّه أنظمة عدة مصطلح VAT أو تحذفه. ملاحظة صريحة: يكتب M3 هنا أصوات تردد المتحدث بينما لا يحتوي النص المرجعي عليها، فلا يصلح هذا المقطع للقول إن M3 يزيل الحشو.

  • محفوظ: Sprint Planning, VAT
  • Cohere: نص غير مدعوم
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: نص غير مدعوم
  • Google latest_long: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
مثال 3كلام قصير
  • المتحدث Omar Khalil
  • المقطع ce9f3a3a_10
  • مدة المقطع 0.71 ث
المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

كيفكم؟

المرجع

كيفكم؟

لماذا يهم هذا المثال تحية تقل مدتها عن ثانية. تطابق مخرجات M3 وCohere وSonix وchirp_3 النص المرجعي تمامًا. لم يُنتج Deepgram Nova-3 وGoogle latest_long شيئًا، وهو ما يُحتسب حذفًا، وأنتج ElevenLabs Scribe كلمة إنجليزية لم تُقل.

  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: محتوى ساقط
  • Google latest_long: محتوى ساقط
مثال 4الأرقام والمصطلحات
  • المتحدث Tareq Faris
  • المقطع 38faf0f4_8
  • مدة المقطع 39.23 ث
المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

مساء الخير (غير مدعوم بالصوت) امبارح خلصت الملفات كلهم طلعوا جوا الـ تبع الـ translated (مصطلح محفوظ) اكسل هلأ هنن حوالي 200 (مصطلح محفوظ) file (مصطلح محفوظ) الدقة طلعت يعني بالـ style (مصطلح محفوظ) حوالي الـ 98 (مصطلح محفوظ) يعني بالـ translation (مصطلح محفوظ) كجودة عم بـ 94 (مصطلح محفوظ) هلأ هدا بعد طبعا عدة تعديلات هلأ اليوم بدي ارفع هلأ هي الـ version (مصطلح محفوظ) وكان في كمان شغل على الـ NBOE (مصطلح محفوظ) يعني حاولنا نعمل صاين تيونينغ هلأ اليوم كمان حتابع

المرجع

صباح الخير امبارح خلصت الملفات كلهم تبع لينا تبع TranslateX حوالي 200 file الدقه طلعت يعني بالـ style حوالي 98 يعني بالـ translation كجوده بال 94 هلا هذا بعد طبعا عده تعديلات هلا اليوم بدي ارفع هلا هي الـ version وكان في كمان شغل على MOE حاولنا نعمل fine-tunning، وسأتابع اليوم كمان

لماذا يهم هذا المثال ثلاثة أرقام منطوقة: 200 ملف، ودرجة 98 للأسلوب، ودرجة 94 لجودة الترجمة. يحتفظ M3 وCohere وchirp_3 بالأرقام الثلاثة. وفي مخرجات أخرى صار 94 هو 40، وصار 98 ثمانية، وحُذف 200، أو صار 98 هو 80 90. ومخرجات M3 هنا ليست خالية من الأخطاء: فهو يفتتح بتحية خاطئة ويخطئ في تهجئة مصطلحين إنجليزيين. وقد استُبدل الاسم الأول المنطوق باسم مستعار في النصوص المفرّغة.

  • محفوظ: translated, file, style, translation, version, NBOE, 200, 98, 94
  • Cohere: نص غير مدعوم
  • ElevenLabs Scribe: نص غير مدعوم
  • Deepgram Nova-3: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Google chirp_3: محتوى ساقط
مثال 5المصطلحات الإنجليزية
  • المتحدث Kareem Saleh
  • المقطع d974dd6c_4
  • مدة المقطع 23.99 ث
المقطع الصوتيمقتطف من اجتماع داخلي في Lisan، وهو الصوت نفسه الذي فرّغته كل الأنظمة.
  • مصطلح محفوظ
  • نص غير مدعوم
  • إدراج حشو
  • لا نص
M3

صباح الخير بالنسبة ليوم الخميس الشغل كان مع فضاءات كان في عندهم مشاكل العلاقة بالـ SDK (مصطلح محفوظ) والسججشنز اللي عم تطلع انحل اغلب الاخطاء صفيان وحدة بدنا نعمل كول عليها اليوم ان شاء الله كمان بدي اشتغل بنسخة الـ dark theme (مصطلح محفوظ) بالـ web app (مصطلح محفوظ) وكمان بدي اعمل مونتورنج للنسخة الجديدة تبع الاي اي ايجنتس يعطيكم العافية

المرجع

صباح الخير، بالنسبة ليوم الخميس الشغل كان مع فضاءات، كان في عندهم مشاكل العلاقة بالـ SDK والـ suggestions اللي عم تطلع، انحل اغلب الاخطاء، صفيان وحدة بدنا نعمل كول عليها اليوم إن شاء الله، كمان بدي اشتغل بالـ بنسخة الـ dark theme بالـ web app، وكمان بدي أعمل monitoring للنسخة الجديدة تبع الـ AI agents، يعطيكم العافية.

لماذا يهم هذا المثال مصطلحات منتج متتالية. يحتفظ M3 بمصطلحات SDK وdark theme وweb app بالحروف اللاتينية، ويكتب suggestions وmonitoring وAI agents صوتيًا، وهو ما تعده قواعد التقييم صحيحًا. ويحتفظ ElevenLabs Scribe بكل المصطلحات لاتينيًا. ويُسقط Sonix معظمها، ويشوّه Google latest_long معظم ما تبقى.

  • محفوظ: SDK, dark theme, web app
  • ElevenLabs Scribe: نص غير مدعوم
  • Sonix: محتوى ساقط
  • Google latest_long: محتوى ساقط
  • Deepgram Nova-3: محتوى ساقط
  • Google chirp_3: محتوى ساقط

سلوك المخرجات عبر الأنظمة

نوعي. إلى جانب معدل الخطأ، سجّل المراجعون كيف تصرّف كل نظام على مجموعة التقييم: هل بقيت المصطلحات الإنجليزية داخل الكلام العربي، وهل ضاع محتوى في بداية المقاطع، وهل تسللت أصوات حشو أو وسوم أحداث أو علامات ترقيم مكررة، وهل دخلت المخرجات في حلقات تكرار. لم تُحسب معدلات إجمالية منفصلة لهذه الملاحظات. وتعرض المصفوفة عبارة المراجعين في كل خلية حتى يمكن التحقق من مطابقة التصنيف (قوي، مختلط، ضعيف، غير مقيَّم) للصياغة الأصلية.

القراءة الصريحة هي أن Google chirp_3 أدى أداءً جيدًا. فقد تعامل بقوة مع المصطلحات التقنية الإنجليزية داخل الكلام العربي، وأظهر فقدانًا منخفضًا للمحتوى، وأنتج مخرجات فارغة أقل بكثير من إعداد الإصدار الأول. وفي عدد من المقاطع النموذجية أعلاه لا يقل اكتمالًا عن M3، ويقتصر الفرق على الكتابة الصوتية بدل الحروف اللاتينية. وحافظ ElevenLabs Scribe على المصطلحات الإنجليزية جيدًا على نحو خاص، لكنه أنتج أصوات حشو زائفة متكررة وانتقالًا واحدًا إلى لغة أو كتابة غير متوقعة. وكان Cohere دقيقًا جدًا في العربية الفصحى ودعم اللهجات الموجودة، بينما رصدت المراجعة حذفًا في المحتوى ومصطلحات غير متسقة وترقيمًا مكررًا وحلقات تكرار. وأظهر Deepgram Nova-3 أخطاء في أسماء المشاركين وحذفًا في بداية المقاطع. وأصاب Google latest_long حين أعاد نصًا فارغًا لكثير من المقاطع الخالية من الكلام، لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف المصطلحات الإنجليزية كثيرًا. وأظهر Sonix أخطاء في الأسماء والمصطلحات الإنجليزية وحذفًا في بداية المقاطع وإفراطًا في علامات نهاية الجمل. ودعمت الأنظمة السبعة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.

سجّل M3 أدنى معدل خطأ على مستوى الأحرف، وبحسب ملاحظات المراجعين حافظ على المحتوى المهم للأعمال والأرقام والمصطلحات بموثوقية أكبر، ولم يُظهر الكثافة نفسها من أصوات الحشو والوسوم والترقيم المكرر في المراجعة. ولم يُقيَّم تمييز المتحدثين لدى الأنظمة الخارجية: فقد تلقى كل منها الصوت نفسه المفصول بحسب المشارك والمُعدّ بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.

تسعة معايير، وسبعة أنظمة، وعبارة واحدة في كل خلية. يُميَّز عمود M3 بخط العلامة التجارية فقط، ولا تُستخدم ألوان الحالة للتمييز. ويكرر الصف الأخير معدل الخطأ المُقاس للمرجعية.

قويمختلطضعيفغير مقيَّم
سلوك المخرجات الملاحظ بحسب المعيار والنظام، من ملاحظات المراجعين على مجموعة التقييم. تتبع المستويات قاعدة واحدة مستمدة من صياغة التقرير: قوي حيث يذكر المراجعون نتيجة إيجابية، وضعيف حيث يذكرون عيبًا، ومختلط حيث تكون الملاحظة مقيدة أو تقول إن المعيار لم يُقيَّم على حدة أو لم تُعزل مشكلة متكررة، وغير مقيَّم حيث لم يُقيَّم المعيار أصلًا. والعبارة معروضة في كل خلية. لم تُحسب معدلات إجمالية منفصلة.
CohereElevenLabs ScribeDeepgram Nova-3Google latest_longGoogle chirp_3SonixM3
العربية الفصحىقويدقيق جدًا.قويدقيق.قويدقيق.ضعيفأخطاء كثيرة.قويدقيق.قويدقيق.قويدقيق جدًا.
الإنجليزية داخل العربيةضعيفحُذفت المصطلحات التقنية والتجارية الإنجليزية أحيانًا أو نُقلت خطأ أو على نحو غير متسق داخل الكلام العربي.قويحُفظت المصطلحات التقنية الإنجليزية جيدًا على نحو خاص في المخرجات المراجعة.مختلطلم يُقيَّم أداء المصطلحات الإنجليزية على حدة؛ أظهرت الأمثلة المراجعة نقلًا غير متسق إلى جانب حذف في بداية المقاطع.ضعيفحُذفت المصطلحات التقنية الإنجليزية كثيرًا.قويحُفظت المصطلحات التقنية الإنجليزية بقوة داخل الكلام العربي.ضعيفنُقلت الأسماء والمصطلحات التقنية الإنجليزية خطأ أو حُذفت كثيرًا.قويحافظ على المصطلحات التقنية والتجارية الإنجليزية باتساق أكبر داخل الكلام العربي.
حذف النصضعيفقد يحذف المحتوى المهم للأعمال أو يشوّهه، بما في ذلك الأرقام والمصطلحات التقنية وأسماء المؤسسات أو المنتجات.مختلطلم يُحسب معدل حذف منفصل؛ كانت المشكلة النوعية الرئيسية إدراج محتوى شبيه بالحشو لا نمط حذف متكرر في بداية المقاطع.ضعيفلوحظ فقدان كبير للمحتوى، خصوصًا في بداية المقاطع المصدرية.مختلطأصاب في رفض كثير من المقاطع الخالية من الكلام، لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف أحيانًا مصطلحات إنجليزية أو أرقامًا.قويلوحظ فقدان منخفض للمحتوى، مع مخرجات فارغة أقل بكثير من إعداد الإصدار الأول.ضعيفلوحظ فقدان للمحتوى خصوصًا في بداية المقاطع المصدرية.قوييحافظ على المحتوى المهم للأعمال بموثوقية أكبر ويقلل فقدان الأرقام والمصطلحات وأسماء المؤسسات أو المنتجات المهمة.
علامات الترقيمضعيفلوحظت أنماط ترقيم مكررة تقلل القابلية للقراءة في المخرجات المراجعة.مختلطلم يُقيَّم على حدة؛ تأثرت القابلية للقراءة بالإدراجات الشبيهة بالحشو أكثر من أي عيب ترقيم متكرر.مختلطلم يُقيَّم على حدة؛ لم يُعزل أي عيب ترقيم متكرر في المراجعة النوعية.مختلطلم يُقيَّم على حدة؛ لم يُعزل أي عيب ترقيم متكرر في المراجعة النوعية.مختلطلم يُقيَّم على حدة؛ لم يُبرَز أي عيب ترقيم متكرر في المراجعة النوعية.ضعيفكانت جودة الترقيم ضعيفة، مع إفراط في علامات نهاية الجمل في المخرجات المراجعة.قويأنتج حدود جمل أوضح من دون الكثافة نفسها من آثار الترقيم المكرر.
التهجئة والمصطلحاتضعيفقد تظهر المصطلحات التقنية والتجارية على نحو غير متسق أو بصيغة صوتية.مختلطعولجت المصطلحات التقنية الإنجليزية جيدًا، لكن الإدراجات الشبيهة بالحشو قللت نظافة النص عمومًا.ضعيفنُقلت أسماء المشاركين خطأ كثيرًا.ضعيفأُغفلت المصطلحات التقنية الإنجليزية كثيرًا، وحُذفت بعض الأرقام.قوينُقلت المصطلحات التقنية الإنجليزية بموثوقية داخل الكلام العربي.ضعيفكان الأداء ضعيفًا في أسماء المشاركين والمصطلحات التقنية الإنجليزية.قويينتج مصطلحات أعمال أكثر اتساقًا للقراءة والبحث.
تكرار الكلماتضعيفلوحظت حلقات تكرار للرموز والعبارات في المخرجات المراجعة.مختلطلم يُحسب معدل تكرار منفصل؛ كانت أصوات الحشو الزائفة المتكررة مشكلة الإدراج الأبرز.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار متكررة في المراجعة النوعية.مختلطلم تُعزل أي مشكلة تكرار كلمات متكررة؛ كان الترقيم مشكلة القابلية للقراءة الأبرز.قويأظهر مشكلات تكرار أقل بكثير في المخرجات المراجعة.
اللهجاتقويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.قويدعمت الأنظمة كلها اللهجات العربية الموجودة في الاجتماعات المقيَّمة.
تمييز المتحدثينغير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.غير مقيَّملم يُقيَّم لدى الأنظمة الخارجية. تلقى كل نظام مقاطع الصوت نفسها المفصولة بحسب المشارك والمُعدّة بواسطة مسار الالتقاط في M3، وقُيّم على التفريغ وحده.قوييستخدم قنوات صوت مرتبطة بالمشاركين ومعلومات المشاركين من المنصة. بقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال الاجتماعات المقيَّمة.
أصوات الحشو ووسوم الأحداثضعيفلوحظت إدراجات شبيهة بالحشو ووسوم على نمط الأحداث وآثار ترقيم مكرر في المخرجات المراجعة.ضعيفلوحظت أصوات حشو زائفة متكررة مثل «آآآ»، وانتقل مقطع واحد إلى لغة أو كتابة غير متوقعة.مختلطلم يُعزل أي نمط متكرر لكلمات حشو أو وسوم أحداث في المراجعة النوعية.مختلطعالج كثيرًا من المقاطع الخالية من الكلام على نحو صحيح، لكنه رفض أيضًا عددًا قليلًا من المقاطع التي تحتوي على كلام.مختلطلم يُبرَز أي نمط متكرر لكلمات حشو أو وسوم أحداث في المراجعة النوعية.مختلطلم يُعزل أي نمط متكرر لوسوم الأحداث؛ كان الإفراط في الترقيم الأثر الأبرز.قويلم يُظهر الكثافة نفسها من آثار الحشو أو الوسوم أو الترقيم المكرر في المراجعة.
معدل الخطأ على مستوى الأحرف (CER)، الأقل أفضل4.93%5.01%6.09%9.01%2.26%9.8%1.62%

السرعة

بحسب تقرير الفريق. يعالج مسار تفريغ الاجتماعات في M3 اجتماعًا مدته ساعة في نحو 45 ثانية على معالج رسومي L4، أي نحو 80 ضعف الزمن الحقيقي. ويصف هذا الرقم معالجة دفعية لصوت متاح مسبقًا، مقيسة على أساس مدة الاجتماع. وليس زمن استجابة مباشرًا من طرف إلى طرف. ويدعم M3 أيضًا المعالجة المباشرة أثناء انعقاد الاجتماع، لكن التسليم المباشر يُقاس على حدة ولا يقدم هذا التقرير رقمًا لزمن الاستجابة المباشر.

ساعة من صوت الاجتماع في نحو 45 ثانية

نحو 80 ضعف الزمن الحقيقي، بحسب تقرير الفريق، على معالج رسومي L4.

معالجة دفعية بحسب تقرير الفريق لمسار تفريغ الاجتماعات في M3 على معالج رسومي L4. يصف معالجة صوت مسجل، لا زمن استجابة الكلام المباشر.

من النص المفرّغ إلى سجل الاجتماع

قدرة في المنتج. يقيّم المعيار أعلاه التفريغ وحده. وفي MeetriX، التفريغ مرحلة واحدة من مسار أطول، يُوصف هنا بوصفه قدرة في المنتج حتى لا يختلط الأمران.

  • التقاط الاجتماع. يُلتقط الصوت مع هوية المشارك المتاحة مرفقة به منذ لحظة الالتقاط، فينتج سجل أوضح لمن قال ماذا.
  • سياق المشارك والزمن. تُحفظ مساهمة كل مشارك مع هوية متحدثها ووقتها في الاجتماع طوال المعالجة. وتُدعم المنصات التي توفر قنوات صوت منفصلة لكل مشارك، والمنصات التي توفر صوتًا مختلطًا مع معلومات نشاط المتحدثين.
  • تهيئة الكلام. تُعالج فترات الصمت والمداخلات القصيرة والوقفات وحدود الكلام قبل التفريغ، فتقل الكلمات المبتورة والتكرار والآثار غير الكلامية.
  • التفريغ العربي والمصطلحات. تُفرَّغ العربية متعددة اللهجات، وتُكتب الأسماء والمصطلحات التقنية الإنجليزية المنطوقة داخل الجمل العربية بصيغتها التجارية المتعارف عليها، فيسهل قراءة النصوص والبحث فيها.
  • سجل اجتماع منظم. يبقى كل مقطع مفرّغ مرتبطًا بمتحدثه الأصلي ووقته في الاجتماع ومقطعه الصوتي المصدري، فينتج سجل مرتبط بالمتحدثين ومُتَّسق زمنيًا يمكن أن يدخل قواعد المعرفة أو التحليلات أو أنظمة إدارة علاقات العملاء أو الأرشيف.
  • الملخص. تحوّل مرحلة ما بعد الاجتماع السجل إلى ملخص موجز يمكن أن يتضمن عنوان الاجتماع وتاريخه ولغته، والحاضرين، وملخصًا عامًا، ونقاط النقاش الرئيسية، والقرارات والتوصيات، والخطوات التالية. والقالب قابل للتخصيص.
  • التسليم بالبريد الإلكتروني. يُرسل الملخص النهائي إلى عناوين البريد الإلكتروني المسجلة للمشاركين، وفق سياسات الوصول والموافقة والاحتفاظ لدى المؤسسة.

في النشر الذي خضع للتقييم، لم يستدعِ مسار التفريغ أي خدمة تفريغ خارجية. ويمكن لـM3 العمل داخل بنية تحتية يتحكم فيها العميل، فتبقى أصوات الاجتماعات والنصوص والملخصات داخل حدود حوكمة البيانات لدى المؤسسة، ويكيّف حمل معالجته مع الموارد الحاسوبية المتاحة مع الحفاظ على هوية المتحدث والطوابع الزمنية وترتيب النص. وبقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال كل اجتماع مقيَّم في مسار قنوات المشاركين لدى M3؛ وهذا بيان تغطية، ولا يُبلَّغ عن معدل خطأ منسوب إلى المتحدثين.

ملاحظة

قدرة في المنتج لا معيار قياس. لم تُقيَّم مرحلتا الملخص والتسليم في هذا التقييم. وتغطي أرقام معدل الخطأ في هذه الصفحة التفريغ وحده.

كيف قسنا

أُعطي كل نظام المادة نفسها وقُيّم بالقواعد نفسها. وتختصر الخطوات أدناه بروتوكول المقارنة وقواعد التقييم من التقرير. وتُنشر حتى يتمكن القارئ من إعادة التقييم على اجتماعاته.

  1. المادة المصدرية

    اجتماعات عمل عربية حقيقية متعددة اللهجات، مع نصوص مرجعية تحقق منها بشر لكل مقطع مقيَّم.

  2. الصوت نفسه لكل نظام

    تلقت الأنظمة السبعة كلها الصوت المصدري نفسه، مقسمًا مسبقًا بواسطة مسار الالتقاط في M3 إلى مقاطع مفصولة بحسب المشارك. وقُيّمت الأنظمة الخارجية على التفريغ وحده؛ ولم يُستخدم تمييز المتحدثين لديها (فصل الصوت بحسب من يتكلم) ولم يُقيَّم. وأُنتج كل رقم للأنظمة المقارنة في هذه الصفحة بتشغيل واجهة المزود على صوت التقييم؛ ولم يُؤخذ أي رقم من منشورات المزودين.

  3. الإعدادات

    شُغّل Google Cloud Speech-to-Text V2 بنموذج chirp_3 مع ar-XA؛ وGoogle Cloud Speech-to-Text V1 بنموذج latest_long مع ar-SA؛ وElevenLabs بنموذج scribe_v1 مع language_code=ara؛ وCohere وDeepgram Nova-3 وSonix.ai كما سُميت، من دون سلسلة نموذج إضافية في التقرير. وشُغّل M3 بوصفه نظام الاجتماعات الكامل مع قنوات صوت مرتبطة بالمشاركين من مسار الالتقاط الخاص به.

  4. المقياس

    معدل الخطأ على مستوى الأحرف = (عمليات الاستبدال + عمليات الحذف + عمليات الإدراج) مقسومًا على عدد حروف النص المرجعي المتحقق منه بشريًا، بعد التطبيع. والدقة على مستوى الأحرف = 100 ناقص معدل الخطأ.

  5. الصيغ اللهجية والفصيحة

    تُعد الكلمة العربية صحيحة سواء كُتبت بصيغتها اللهجية أو بصيغتها الفصيحة، ما دام المعنى واحدًا.

  6. الكلمات الإنجليزية

    تُعد الكلمة الإنجليزية صحيحة سواء كُتبت بالحروف اللاتينية، أو رُسمت صوتيًا بالحروف العربية، أو تُرجمت إلى كلمة عربية مكافئة.

  7. الأرقام

    تُقارن بالقيمة: 15 و١٥ وخمسة عشر تُعد الشيء نفسه. وتبقى الأرقام ومصطلحات الأعمال الإنجليزية ضمن المحتوى المقيَّم ولا تُحذف منه.

  8. الترقيم وحالة الأحرف وأشكال الحروف والمسافات

    يُهمل الترقيم كليًا. ولا يفرّق النص اللاتيني بين الأحرف الكبيرة والصغيرة. وتُطبَّع أشكال الحروف العربية مثل صور الألف. وتُهمل المسافات، إلا أن المسافة المفقودة التي تدمج كلمتين تُحتسب خطأ واحدًا.

  9. الفروق المتبقية

    بعد تطبيق هذه المكافئات، يُعد كل حرف مفقود أو مضاف أو مستبدل خطأ. ولا تدخل في معدل الخطأ إلا المقاطع ذات النص المرجعي المتحقق منه. ويُحتسب المخرج الفارغ مقابل نص مرجعي يحتوي على كلام حذفًا؛ ويُحتسب المخرج الإضافي غير المدعوم إدراجًا.

  10. المراجعة النوعية

    سجّل المراجعون لكل نظام حذف المحتوى، والأسماء والمصطلحات الإنجليزية، والإدراجات الشبيهة بالحشو، والتغيرات اللغوية غير المتوقعة، والترقيم المكرر، وحلقات التكرار. ولم تُحسب معدلات إجمالية منفصلة.

خريطة الأدلة

الادعاءالنطاقالحالة
معدل خطأ على مستوى الأحرف 1.62% لـ M3 مقابل 2.26% لـ Google chirp_3، و4.93% لـ Cohere، و5.01% لـ ElevenLabs Scribe، و6.09% لـ Deepgram Nova-3، و9.01% لـ Google latest_long، و9.8% لـ Sonix؛ وانخفاضات نسبية تقريبية قدرها 28% و67% و68% و73% و82% و83%.مجموعة التقييم نفسها من اجتماعات حقيقية متحقق منها بشريًا، بالنص المرجعي نفسه وقواعد التقييم نفسها.مُقاس.
أظهر Deepgram Nova-3 أخطاء في أسماء المشاركين وحذفًا في بداية المقاطع؛ وحافظ ElevenLabs Scribe على المصطلحات التقنية الإنجليزية جيدًا لكنه أنتج أصوات حشو زائفة متكررة وانتقالًا واحدًا غير متوقع في اللغة أو الكتابة؛ وعالج Google latest_long كثيرًا من المقاطع الخالية من الكلام بشكل صحيح لكنه أغفل عددًا قليلًا من المقاطع التي تحتوي على كلام وحذف المصطلحات الإنجليزية كثيرًا مع حذف عرضي للأرقام؛ وتعامل Google chirp_3 بقوة مع المصطلحات التقنية الإنجليزية وأظهر فقدانًا منخفضًا للمحتوى؛ وأظهر Sonix أخطاء في الأسماء والمصطلحات التقنية الإنجليزية وحذفًا في بداية المقاطع وإفراطًا في علامات نهاية الجمل.مراجعة نوعية لمجموعة التقييم نفسها.مُلاحظ نوعيًا؛ لم تُحسب معدلات إجمالية منفصلة.
بقيت نسبة الكلام إلى المتحدثين المقدمة من المنصة مرتبطة طوال كل اجتماع مقيَّم.مسار قنوات المشاركين في M3؛ قُيّمت الأنظمة الخارجية على التفريغ وحده.مُقاس لمسار قنوات المشاركين في M3.
معالجة دفعية بنحو 80 ضعف الزمن الحقيقي؛ نحو 45 ثانية لكل ساعة من صوت الاجتماع.مسار تفريغ الاجتماعات في M3 لاجتماع مدته ساعة على معالج رسومي L4.بحسب تقرير الفريق؛ معالجة دفعية لا زمن استجابة مباشرًا.
لا استدعاء لخدمة تفريغ خارجية.مسار التفريغ الذي خضع للتقييم.تم التحقق منه في النشر الذي خضع للتقييم.

الحدود

  • مجموعة تقييم واحدة. يأتي كل رقم لمعدل الخطأ من مجموعة تقييم واحدة من اجتماعات حقيقية متحقق منها بشريًا. وتبيّن كيف تقارنت الأنظمة السبعة على تلك المادة، ولا ينبغي قراءتها بوصفها معدلًا عامًا لأي منها.
  • لقطة زمنية. استُدعيت الواجهات المقارنة في سبتمبر 2026 بالإعدادات المذكورة في فقرة «كيف قسنا». ويحدّث المزودون نماذجهم، فتصف الأرقام تلك الإصدارات في ذلك التاريخ.
  • هامش ضيق في الصدارة. الفارق بين M3 وGoogle chirp_3 هو 0.64 نقطة مئوية، وفي عدد من المقاطع النموذجية لا يقل chirp_3 اكتمالًا عن M3. الترتيب مُقاس؛ أما وزنه فيُقرأ مع تحفظ المجموعة الواحدة.
  • سرعة المعالجة بحسب تقرير الفريق. أبلغ الفريق عن رقمي 45 ثانية لكل ساعة و80 ضعفًا لإعداد عتادي واحد، وليسا جزءًا من المعيار المقيَّم. ولم يُقس زمن الاستجابة المباشر لهذا التقرير.
  • الملاحظات النوعية بلا معدلات إجمالية. تأتي العبارات عن الحشو والحذف والتكرار والترقيم من ملاحظات المراجعين. وتتبع مستويات المصفوفة قاعدة واحدة مطبقة على صياغة تلك الملاحظات، وتُعرض العبارات حتى يمكن الطعن في التصنيف.
  • لم يُقيَّم تمييز المتحدثين لدى الأنظمة الخارجية. تلقى كل نظام خارجي صوتًا مفصولًا بحسب المشارك أعدّه M3، فتعزل المقارنة التفريغ ولا تقول شيئًا عن كيفية نسبة تلك الأنظمة الكلام إلى المتحدثين على صوت مختلط. ونتيجة نسبة الكلام إلى المتحدثين لدى M3 بيان تغطية؛ ولا يُبلَّغ عن معدل خطأ منسوب إلى المتحدثين.
  • M3 ليس خاليًا من الأخطاء. تعرض بطاقات الأمثلة M3 وهو يكتب أصوات التردد التي لا يحتوي عليها النص المرجعي، ويضيف كلمات لا ترد فيه.
  • الخطوات التالية. توسّع مرحلة التقييم التالية الاختبار ليشمل مؤسسات إضافية ومنصات اجتماعات ولهجات وظروفًا صوتية ومصطلحات خاصة بالعملاء. ويمكن للمؤسسات تقييم M3 على اجتماعاتها الآن.
النتائج الكاملة
النتائج الكاملة للأنظمة السبعة. مُقاسة على الاجتماعات نفسها المتحقق منها بشريًا، بالنص المرجعي نفسه وقواعد التقييم نفسها؛ انظر فقرة كيف قسنا. الأفضل في العمود
الترتيبالنظامتفصيل البروتوكولمعدل الخطأ على مستوى الأحرف (%)، الأقل أفضلالدقة على مستوى الأحرف (%)الانخفاض النسبي لـ M3 (%)، تقريبيالانخفاض المطلق بالنقاط
1Complete M3 meeting systemComplete M3 meeting system; participant-linked audio channels supplied by the M3 capture workflow1.62 (الأفضل في العمود)98.38 (الأفضل في العمود)الأساس
2Google Cloud Speech-to-Text V2 (chirp_3)chirp_3, ar-XA2.2697.74280.64
3CohereCohere (no model string given in the white paper)4.9395.07673.31
4ElevenLabs Scribe v1scribe_v1, language_code=ara5.0194.99683.39
5Deepgram Nova-3Deepgram Nova-3 (no further model string given)6.0993.91734.47
6Google Cloud Speech-to-Text V1 (latest_long)latest_long, ar-SA9.0190.99827.39
7Sonix.aiSonix.ai (no model string given)9.890.283 (الأفضل في العمود)8.18 (الأفضل في العمود)

للاستشهاد بهذا التقرير، استخدم المرجع التالي أو حقول BibTeX أدناه.

للاستشهاد بهذه الصفحة

Lisan Research (2026). M3: Arabic meeting transcription, measured on real meetings. Evaluation Edition, September 2026. Lisan, 15 September 2026. https://lisan.com/company/research/m3/
BibTeX
@techreport{lisan2026m3,
  author = {Lisan Research},
  title = {M3: Arabic meeting transcription, measured on real meetings},
  institution = {Lisan},
  type = {Evaluation report},
  year = {2026},
  month = {September},
  note = {Evaluation Edition, September 2026. Published 15 September 2026},
  url = {https://lisan.com/company/research/m3/},
}

شغّل M3 على اجتماعاتك أنت

المعيار الذي يهم هو صوتك أنت. يشغّل البرنامج التجريبي M3 على عينة من اجتماعاتك مع نص مرجعي متحقق منه بشريًا، ونشاركك قواعد التقييم قبل التشغيل، فتُقاس النتيجة بالطريقة نفسها التي قيس بها هذا التقرير.

أسئلة شائعة

ما معدل الخطأ على مستوى الأحرف، وهل يستخدم هذا التقرير معدل الخطأ في الكلمات؟

معدل الخطأ على مستوى الأحرف (CER) هو نسبة الحروف التي لزم إضافتها أو حذفها أو تغييرها في النص المفرّغ حتى يطابق ما تحقق البشر من أنه قيل. ويحسب هذا التقرير المعدل بعد قواعد التطبيع المذكورة في فقرة «كيف قسنا»، فتُعد الصيغ اللهجية والفصيحة، والإنجليزية اللاتينية والصوتية، وصيغ الأرقام متكافئة. ولا يُبلَّغ هنا عن معدل الخطأ في الكلمات، وتحل نتائج هذا التقييم محل أرقام MeetriX السابقة المنشورة بمعدل الخطأ في الكلمات.

هل تحقق طرف مستقل من التقييم؟

لا. أجرت Lisan Research التقييم. ويُنشر البروتوكول وقواعد التقييم والأمثلة وخريطة الأدلة في هذه الصفحة حتى يمكن إعادة التقييم، والبرنامج التجريبي على اجتماعاتك مع نص مرجعي متحقق منه بشريًا هو الطريقة للتحقق من النتيجة على مادتك.

ما مدى قرب Google chirp_3؟

قريب. سجّل 2.26% مقابل 1.62% لـ M3، بفارق 0.64 نقطة مئوية، وتنسب إليه المراجعة تعاملًا قويًا مع المصطلحات الإنجليزية وفقدانًا منخفضًا للمحتوى. والفروق المتبقية هي الكتابة اللاتينية مقابل الصوتية للمصطلحات، وكثافة الآثار غير المرغوبة، والمسار المرتبط بالمتحدثين حول M3 الذي كان خارج مقارنة التفريغ.

هل يرسل M3 صوت الاجتماعات إلى واجهة برمجية سحابية للتعرف على الكلام؟

في النشر الذي خضع للتقييم لم يستدعِ مسار التفريغ أي خدمة تفريغ خارجية. ويمكن لـ M3 العمل داخل بنية تحتية يتحكم فيها العميل، فتبقى أصوات الاجتماعات والنصوص والملخصات داخل حدود حوكمة البيانات لدى المؤسسة.

هل يمكننا تقييم M3 على اجتماعاتنا؟

نعم. يشغّل البرنامج التجريبي M3 على عينة من اجتماعاتك مقابل نص مرجعي متحقق منه بشريًا، مع مشاركة قواعد التقييم قبل التشغيل. راسل support@lisan.com أو احجز برنامجًا تجريبيًا عبر MeetriX.