أدلة ورؤى

خندق اللهجات لم يعد قائمًا: ما الذي يجب أن تبنيه منصات الاستماع الإقليمية بعد ذلك

| 23 min read | 4531 كلمة
شارك:

تتكرر أربعة أسماء كلما بحثت علامة تجارية ناطقة بالعربية عن منصة استماع اجتماعي. Crowd Analyzer التي تعمل من القاهرة ودبي. Lucidya في الرياض. AIM Technologies في القاهرة. وdima من الخليج. اسأل أيًا منها عمّا يميزها عن Brandwatch أو Meltwater وستحصل على صيغة من الجملة نفسها: المنصات العالمية بُنيت للإنجليزية، وهي لا تستطيع قراءة الطريقة التي يكتب بها العرب فعليًا.

على مدى عقد تقريبًا كانت تلك الجملة صحيحة وحاملة للثقل وتساوي مالًا كثيرًا. لقد بنت فئة كاملة. وفي يوليو 2025 ساعدت Lucidya على جمع 30 مليون دولار في جولة من الفئة ب، وُصفت حينها بأنها أكبر جولة تمويل للذكاء الاصطناعي تُغلق في المنطقة العربية.

الجملة اليوم تؤدي عملًا أقل بكثير مما يبدو أن قائليها يدركون. لا لأن هذه الشركات لم تبنِ شيئًا (فقد بنت الكثير، في ظروف كانت صعبة فعلًا)، بل لأن القدرة المحددة التي بنت عليها عرضها انزلقت نحو أن تصبح سلعة عامة بينما بقي العرض في مكانه. صار بإمكان مشترٍ في الرياض أن يفتح صفحة في متصفحه، ويلصق تغريدة خليجية فيها ثلاثة استبدالات بالفرانكو آراب في نموذج عام الغرض، ويشاهدها تُحلَّل تحليلًا صحيحًا، مجانًا، خلال أربع ثوانٍ تقريبًا.

هذه المقالة تتناول ما حدث لذلك الخندق، وما الذي يجب أن تعنيه أرقام الدقة المنشورة على الصفحات الرئيسية لهؤلاء الموردين كي تكون صحيحة، وما الذي يبقى قابلًا للدفاع عنه فعلًا، وأين يقع المُمايِز الحقيقي التالي. الجزء الأخير يأخذ أكبر مساحة، لأنه الجزء الذي فيه هندسة حقيقية: تكييف النماذج مع لغة بعينها وسوق بعينه وتصنيف عميل بعينه، وحساب ما يكلّفه تشغيل ذلك على ملايين المنشورات شهريًا.

الادعاء الذي بنى فئة كاملة

لنبدأ بالإنصاف لهذا الادعاء، لأنه كان ادعاءً جيدًا.

العربية ليست لغة واحدة من منظور مصنِّف نصوص. العربية الفصحى الحديثة هي سجل نشرات الأخبار والبيانات الرسمية والكتابة الرسمية. ولا أحد تقريبًا ينشر بها. ما يتدفق فعليًا عبر منصة استماع هو المصرية والشامية والخليجية والمغاربية واثنتا عشرة صيغة أدق، مكتوبة دون تشكيل، بإملاء غير مستقر، مع تنقّل لغوي كثيف نحو الإنجليزية والفرنسية، وحجم كبير من الفرانكو آراب (العربية مكتوبة بحروف لاتينية مع أرقام تحلّ محل الأصوات التي يفتقر إليها النص اللاتيني، فتصير الحاء 7 والعين 3).

نموذج تحليل مشاعر مُدرَّب على تغريدات إنجليزية لا يتدهور أداؤه بلطف على هذا المُدخَل. إنه يفشل بطرق تبدو كالنجاح، فيعيد تصنيفات محايدة واثقة على نص لم يفهمه إطلاقًا. وأي شخص شغّل منصة عالمية على المحادثة الخليجية عام 2016 شاهد هذا يحدث واستخلص النتيجة الصحيحة.

فبنى الموردون الإقليميون البديل، وما زال تسويقهم الحالي يتصدّر به. تعلن Crowd Analyzer عن 176 لغة أو أكثر بدقة 91% من نماذج صُقلت على ثلاثة مليارات سجل. وتدّعي AIM Technologies اثنتي عشرة لهجة عربية مُسمّاة إضافة إلى الفرانكو آراب ودقة مشاعر عربية تبلغ 92%. وتدّعي dima دقة 97% عبر كل اللهجات والعامية والفرانكو آراب. أما Lucidya فقد نشرت رقمًا يتجاوز 92%.

ممّ كان ذلك الخندق مصنوعًا فعلًا

الأصول التي تقف خلف تلك الادعاءات كانت حقيقية ومكلفة، ولم تكن هي النماذج. قبل 2023، كان بناء مصنِّف لهجات عربية عاملٍ يعني تجميع وصيانة ما يلي:

  • مدوّنات لهجية موسومة. عشرات أو مئات الآلاف من المنشورات، موسومة من ناطقين أصليين بالصيغة المحددة، ما كان يعني توظيف واستبقاء موسِّمين مصريين وشوام وخليجيين كلٌّ على حدة.
  • التحليل الصرفي. العربية لغة اشتقاقية وغنية بالتصريف. كلمة إملائية واحدة قد تحمل حرف جر وفعلًا وفاعلًا ومفعولًا وضمير ملكية. والوصول إلى وحدة رمزية قابلة للاستخدام كان يتطلب غالبًا محلِّلًا مخصصًا.
  • معاجم اللهجات وقواعد التطبيع. خرائط مبنية يدويًا لتباين الإملاء والتمطيط والكتابة المجاورة للإيموجي ونقل الفرانكو آراب، يصون كلًّا منها شخص يعرف اللهجة معرفة شخصية.
  • مُجزّئات رمزية مخصصة. المفردات الفرعية عامة الغرض كانت تمزّق العربية إلى شظايا حرفية، فدرّب الموردون الإقليميون مجزئاتهم الخاصة.

لا شيء من ذلك رخيص ولا سريع. استغرق سنوات، وتطلّب أشخاصًا يعيشون في المنطقة، وأنتج موقعًا قابلًا للدفاع عنه لأن منافسًا في لندن لم يكن بوسعه ببساطة أن يشتريه. كان ذلك خندقًا حقيقيًا، والشركات التي حفرته تستحق التقدير على هذا العمل.

ما تغيّر هو أن النماذج الحدودية استوعبت معظم تلك القدرة كأثر جانبي للحجم، وأن أدوات بناء مصنِّف مخصص انهارت بشكل منفصل من مشروع بحثي إلى مربع نص.

الرقم الذي لا يسأل عنه أحد

هنا يأتي الجزء غير المريح، وهو غير مريح للفئة كلها لا لأي مورد بعينه.

مسابقة التعرّف الدقيق على اللهجات العربية هي أقرب ما يملكه المجال إلى لوحة نتائج محايدة. تُقام سنويًا، وتنشر مجموعات بياناتها، والفرق المتنافسة فيها هي مجموعات أبحاث المعالجة اللغوية العربية التي يقرأ فِرَقُ هندسة الموردين أوراقها. في نسخة 2024، سجّل النظام الفائز في التعرّف متعدد التسميات على اللهجة على مستوى الدولة متوسط F1 كليًّا قدره 50.57. وفي مهمة الترجمة من اللهجة إلى الفصحى المصاحبة، سجّل الفائز 20.44 BLEU.

خمسون تقريبًا. هذه هي أحدث ما وصل إليه المجال، متنافَسًا عليه علنًا، على مجموعة اختبار منشورة، من فرق هذه المشكلة هي عملها كله.

والآن ضع ذلك بجوار 97%.

الرقمان لا يقيسان الشيء نفسه، وهذه هي المسألة بالضبط. لا أحد يستطيع أن يعرف ما الذي تقيسه أرقام الموردين، لأن أيًّا من الشركات الأربع لا ينشر تعريفًا للمهمة، ولا مجموعة اختبار، ولا تصنيفًا للتسميات، ولا تفصيلًا حسب اللهجة، ولا رقمًا لاتفاق الموسِّمين. النسبة المئوية بلا مقام هي زينة.

ما الذي يجب أن تعنيه 97%

اعمل رجوعًا من الادعاء وسيبدأ في التفكك عند أول ملامسة.

إن كانت «دقة 97% عبر كل اللهجات» تعني التعرّف على اللهجة على مستوى الدولة، فهي نحو ضعف أفضل نتيجة مُقاسة علنًا في المجال، والمورد الجالس على ذلك كانت لديه ورقة بحثية لا صفحة هبوط. وإن كانت تعني تحليل مشاعر ثنائيًا بين الإيجابي والسلبي على نص مُرشَّح مسبقًا وواضح القطبية، فإن 97% غير لافتة والرقم يُقتبس لمهمة لا يجد فيها أحد صعوبة. وإن كانت تعني تحليل مشاعر ثلاثيًا يشمل المحايد على حركة إنتاج حقيقية، فهي تصطدم بقيد أصعب، وهو أن البشر أنفسهم لا يستطيعون الاتفاق فيما بينهم بذلك المعدل.

سقف الموسِّمين

لوسم المشاعر مشكلة موثوقية موثّقة جيدًا. عبر الأدبيات، يتفق الموسِّمون البشر الذين يصنّفون نصًا اجتماعيًا إلى فئات مشاعر ثنائية أو ثلاثية فيما بينهم بنسبة 70% إلى 80% تقريبًا، مع قيم منشورة لمعامل كابا لكوهين تقع كثيرًا في نطاق 0.41 إلى 0.60 الذي يسميه مقياس التفسير المعياري «متوسطًا». ويتركّز الخلاف كله تقريبًا في فئة المحايد، وهي أيضًا أكبر فئة في معظم تدفقات مراقبة العلامات التجارية.

هذا مهم لأن سقف مصنِّفك هو جودة تسمياتك. فإن اختلف ناطقان أصليان كفؤان ينظران إلى التغريدة الخليجية نفسها حول ما إذا كانت سلبية أم محايدة في ربع الحالات، فإن دقة مُبلَّغة بنسبة 97% في مطابقة معيار ذهبي تخبرك بشيء عن كيفية بناء ذلك المعيار الذهبي أكثر مما تخبرك بشيء عن النموذج. والتفسيرات الأرجح هي مجموعة اختبار صغيرة، أو موسِّم واحد، أو مهمة اختُزلت إلى فئتين سهلتين، أو ذلك كله.

وهناك تلوّث ثانٍ أدقّ يستحق المعرفة. وجد بحث عُرض في مؤتمر ACL عام 2025 أن الموسِّمين البشر حين يُعرض عليهم تصنيف مقترح من نموذج قبل أن يقرروا، فإنهم يرتكزون إليه بقوة كافية لإزاحة توزيع التسميات بأكمله. وإذا استُخدمت تلك التسميات المرتكِزة بعد ذلك لتقييم النموذج، فإن الأداء المقيس يُنفَخ. وأي مورد أُنتجت مجموعته الذهبية «المتحقَّق منها بشريًا» من أشخاص يراجعون مخرجات النموذج إنما يبلّغ عن رقم يقيس جزئيًا تأثيره هو.

والنمط يمتد إلى ما بعد الموردين العرب الأصليين. تُبلغ Socialhose عن دقة 97% في التعرّف على اللهجة داخل بثوث TikTok المباشرة التي تفرّغها وتحللها، وتنسب النتيجة إلى نماذج ذكاء اصطناعي لا تسمّيها. وذلك الادعاء أكثر إثارة للاهتمام من معظم غيره، لأنه يصف مسارًا أصعب فعلًا: تعرّف على الكلام في صوت مباشر، ثم تحديد للهجة على النص المفرّغ الناتج، مع تراكم الأخطاء عبر مرحلتين. وهو يستدعي الأسئلة نفسها تمامًا التي يستدعيها كل رقم آخر هنا. سبعة وتسعون بالمئة من ماذا، مقاسة مقابل تفريغ من؟ على كم ساعة من الصوت؟ وعبر أي لهجات؟ والمعيار المقترح في هذه المقالة ينطبق على كل مورد في الفئة، بما في ذلك المنصات المعروضة على هذا الموقع.

ولنكن صريحين في ما يُطرح هنا: الادعاء ليس أن هؤلاء الموردين يكذبون. بل أن الأرقام غير قابلة للتفنيد بصيغتها المنشورة، وأن سوقًا يقبل ادعاءات دقة غير قابلة للتفنيد هو سوق توقّف فيه ادعاء الدقة عن العمل كمُمايِز. الجميع يستطيع قول 92%. وعدد منهم يقولها فعلًا.

أين تقف النماذج الحدودية فعلًا من العربية

النسخة الصادقة من الحجة تستلزم الاعتراف بأن النماذج عامة الغرض لم تفز ببساطة. فالبحث يقول شيئًا أكثر تحديدًا وأكثر إثارة للاهتمام.

يبقى أوسع تقييم منهجي لنموذج عام على العربية هو GPTAraEval (مؤتمر EMNLP 2023)، الذي أجرى 44 مهمة فهم وتوليد لغوي عبر أكثر من 60 مجموعة بيانات. وكانت خلاصته الرئيسية أنه رغم الأداء الممتاز بالإنجليزية، فإن ChatGPT تتفوق عليه باستمرار نماذج أصغر خضعت لضبط دقيق على العربية. كما أكد أن ChatGPT وGPT-4 كليهما تعاملا مع العربية الفصحى الحديثة بشكل أفضل ملحوظًا من العربية اللهجية.

وقد تقادمت تلك النتيجة في اتجاه بعينه. صارت أقل صحة بالنسبة للهجات واسعة الانتشار، وبقيت صحيحة بعناد بالنسبة لما عداها. فقد وجد معيار من نوفمبر 2025 على اللهجة التونسية، اختبر النقل الحرفي والترجمة والمشاعر على نص متوازٍ بالتونيزي والتونسية القياسية والإنجليزية، أن أفضل نموذج أداءً بلغ دقة قدرها 0.60 ومتوسط F1 كليًّا قدره 0.45 على المشاعر. على لهجة شمال أفريقية شحيحة الموارد، في أواخر 2025، كانت النماذج الحدودية تؤدي أداءً قريبًا من رمي عملة في الفئات الأصعب.

التقسيم الصادق

مجتمعةً، تدعم الأدلة موقفًا دقيقًا إلى حد بعيد:

  • المصرية والشامية والخليجية محلولة عمليًا لأغراض التطبيق. فهذه أوفر اللهجات موارد، وهي تهيمن على حجم وسائل التواصل العربية، ونموذج حدودي بتوجيه جيد يتعامل معها باقتدار. وهذه بالضبط هي الأرض التي يشغلها تسويق الموردين الإقليميين.
  • المغاربية والسودانية واليمنية والعراقية تبقى صعبة فعلًا على النماذج العامة، والمورد الذي يملك بيانات موسومة حقيقية بتلك الصيغ يملك شيئًا يستحق الاقتناء. ولاحظ أن هذا قريب من عكس ما يشدّد عليه التسويق. وشكل هذه الفرصة مرئي في لغات أخرى: فقد تفوّق مُرمِّز متعدد اللغات بحجم 307 مليون معامل صدر في سبتمبر 2025 على كلٍّ من Gemini 2.5 Pro وo3 من OpenAI في الإجابة عن الأسئلة بالفاروية، لأن اللغات شحيحة الموارد هي بالتحديد حيث يتغلب التدريب الموجَّه على الحجم الخام.
  • النماذج الأصغر المضبوطة دقيقًا ما زالت تتفوق على النماذج العامة الموجَّهة في مهام التصنيف الضيقة. وهذه أهم نتيجة منفردة في الأدبيات كلها بالنسبة لهذه الصناعة، وهي تشير مباشرة إلى موضع الخندق التالي.

النقطة الثالثة تستحق التشديد لأنها تتعارض مع النسخة الكسولة من قصة «النماذج اللغوية الكبيرة التهمت كل شيء». مُرمِّز بحجم 300 مليون معامل رأى تسمياتك سيتفوق في التصنيف على نموذج عام بحجم تريليون معامل رأى توجيهك. النموذج العام أقدر؛ والنموذج المتخصص أفضل معايرة لمهمتك. وتلك الفجوة عمل تجاري.

وهي فجوة تصادف أنها تخدم هذه الصناعة تحديدًا. فقد وجدت مقارنة من يناير 2026 بين مُرمِّزات مضبوطة دقيقًا ونماذج حدودية موجَّهة عبر أربع مجموعات بيانات تصنيف أن النتيجة تنقسم حسب طول المستند: على المستندات الطويلة فازت النماذج الحدودية، وعلى المستندات القصيرة فازت المُرمِّزات فوزًا صريحًا بينما كلّفت تشغيلًا أقل بمقدار 37 إلى 90 مرة. والمنشورات الاجتماعية مستندات قصيرة. الدقة والاقتصاد يشيران هنا إلى الاتجاه نفسه، وهو ما لا يصح في كل مجال.

وثمة حدّ يستحق الذكر صراحةً، لأن النسخة الشائعة من هذه الحجة تتجاوزه. المُرمِّزات الصغيرة تتفوق على النماذج الحدودية الموجَّهة. وهي لا تتفوق عمومًا على النماذج المضبوطة دقيقًا. فقد وضعت دراسة من يناير 2025 على المشاعر الثلاثية نموذج GPT-4o-mini المضبوط دقيقًا عند 86.77 من متوسط F1 الكلي مقابل ELECTRA-large المضبوط دقيقًا عند 82.36. وميزة المُرمِّز أنه يحطّ ضمن نقاط قليلة بجزء صغير من التكلفة، وهي الحجة التي تهمّ عند الحجم الكبير.

الميزة التي حوّلت الفئة بهدوء إلى سلعة

بينما كان الجدال حول فهم اللهجات جاريًا، أزالت المنصات العالمية النصف الآخر من الخندق، وهو عمل بناء الفئات المخصصة.

أطلقت Talkwalker مصنِّف الذكاء الاصطناعي بنقرة واحدة في 31 أكتوبر 2022، أي قبل شهر من إتاحة ChatGPT للجمهور. يكتب المستخدم وصفًا قصيرًا بلغة طبيعية لفئة ما، فتصنّف المنصة ملايين المحادثات الاجتماعية غير المهيكلة مقابله، دون أي تدريب. ونص الإطلاق صريح فيما يستبدله: قواعد بوليانية مبنية يدويًا ووسم يدوي لمجموعات بيانات كبيرة.

ويغطي مساعد Iris من Brandwatch أرضًا مشابهة بالتقسيم التلقائي والبحث بلغة طبيعية وتحليل الصور. أما Sprinklr فتواصل شحن قدرات مبنية على النماذج اللغوية في منصتها Unified-CXM بوتيرة منتظمة.

تأمل ما يفعله هذا بمحادثة البيع الإقليمية. كان العرض التاريخي أن الأدوات العالمية تجبرك على كتابة سلاسل بوليانية عربية هشّة تُفوّت المتغيرات اللهجية، بينما الأداة الإقليمية تفهم لغتك فهمًا أصيلًا. واعتبارًا من أواخر 2022، على منصة عالمية، لم يعد المشتري يكتب سلاسل بوليانية أيضًا. بل يصف الفئة في جملة، بأي لغة، ويتولى نموذج الباقي. والمقارنة التي يريد المورد الإقليمي عقدها هي مع منتج لم يعد موجودًا منذ ما يقارب أربع سنوات.

ما الذي ما زال قابلًا للدفاع عنه فعلًا

الكثير، كما تبيّن. غير أن المزايا الدائمة تقع ببساطة في مكان آخر غير تقنية اللغة.

الوصول إلى البيانات. هذه هي الميزة الحقيقية. يحمل Snapchat وTikTok حصة من المحادثة الخليجية لا نظير لها في الغرب، والوصول إليهما مسألة تجارية وقانونية أكثر منها مسألة نمذجة. أضف إليها رصد الصحافة المطبوعة والتلفزيون والإذاعة العربية عبر أكثر من عشرين دولة، وهو ما يتطلب حضورًا ماديًا وعلاقات ترخيص، فتحصل على شيء لا يستطيع منافس أن يكرره من حاسوب محمول. وقد جعل انهيار واجهات المنصات الرخيصة بعد 2023 الوصولَ إلى البيانات أكثر قيمة لا أقل، والموردون الذين يحملون بهدوء تراخيص جيدة في موقع أقوى مما يوحي به تسويقهم ذاته.

إقامة البيانات والمشتريات الحكومية. لدى المشترين في القطاع العام السعودي والإماراتي متطلبات بشأن مكان إقامة البيانات ومن يمكن إجباره على تسليمها. والمورد المسجَّل في الرياض ببنية تحتية محلية يجتاز بوابات مشتريات لا تستطيع منصة مستضافة في الولايات المتحدة اجتيازها. وهذا يساوي مالًا حقيقيًا، وهو منفصل تمامًا عن جودة نموذج المشاعر.

لغة المنتج لا لغة البيانات. واجهة عربية من اليمين إلى اليسار مبنية على نحو صحيح، ودعم بالعربية في منطقة المشتري الزمنية، وتقارير يستطيع مسؤول تنفيذي سعودي تعميمها دون ترجمة. وتبقى المنصات العالمية ضعيفة هنا ولا تبدي كبير اهتمام.

السرعة والخدمة. تعلن dima عن تجهيز الحساب في أقل من 48 ساعة بعد عرض توضيحي. ومقابل منصات مؤسسية تقيس التهيئة بالأشهر، تلك ميزة حقيقية.

هذه كلها حقيقية. وهي أيضًا، دون استثناء، خنادق توزيع وتشغيل لا خنادق تقنية. إنها قابلة للدفاع عنها، وتستحق البناء عليها، والشركة التي تستند إليها تقول الحقيقة. المشكلة أن خندق التوزيع لا يدعم علاوة سعرية تقنية، والتسعير في هذه الفئة مسعَّر كعلاوة تقنية. فالموردون الأربعة جميعًا يعرضون تسعيرًا مخصصًا غير منشور وبعقد سنوي حصرًا، وهو تموضع برمجيات مؤسسية.

الضبط الدقيق باعتباره المُمايِز التالي

هنا تسكن الهندسة المثيرة للاهتمام، وهي متاحة تحديدًا للشركات التي تدافع حاليًا عن التلّة الخطأ.

المنطق يجري هكذا. توجيه نموذج حدودي سلعة عامة، لأن منافسك يستطيع كتابة التوجيه نفسه مقابل النقطة الطرفية نفسها بعد ظهر اليوم. وأي شيء يمكن التعبير عنه في توجيه يمكن نسخه في يوم. وما لا يمكن نسخه هو مدوّنة موسومة كبيرة ونظيفة وخاصة بمجالك وبلغتك، تعكس التصنيفات الفعلية لعملائك، ومتراكمة عبر سنوات من حركة الإنتاج.

أي بعبارة أخرى: المدوّنة هي الأصل والنموذج مستأجَر. تقول Crowd Analyzer إن نماذجها صُقلت على ثلاثة مليارات سجل. وإن كان ذلك صحيحًا ولو في اتجاهه العام، فإن السجلات تساوي أكثر مما ساوته النماذج يومًا، وهي جالسة هناك كبيانات تدريب لخطوة تكييف لا يقوم بها أحد في الفئة بصوت عالٍ.

وتلك العبارة الأخيرة تستحق أن تُؤخذ حرفيًا. فالبحث في الأدبيات المنشورة عن التقطير المطبَّق على تصنيف وسائل التواصل بحجم ملايين المنشورات يعثر على معايير أكاديمية ومجالات مجاورة كالتمويل وتحليل التعليقات التنظيمية، ولا يعثر على شيء يُذكر من هذه الصناعة. ولا ينشر أي مورد استماع كبير، عالمي أو إقليمي، أي أرقام عن إنتاجية التصنيف أو تكلفته إطلاقًا. وبالنسبة لقطاع يبيع تحليل البيانات، فإن غياب أرقام منشورة عن تحليله هو لبياناته لافت، وهو يعني أن أول مورد يقوم بهذا العمل على نحو صحيح لن يكون أمامه معيار عام يُقاس مقابله.

ما الذي يكلّفه التكييف فعلًا

بنية التكلفة هنا تفاجئ من لم ينظر إليها حديثًا. فقد صار الضبط الدقيق الموفّر للمعاملات شبه مجاني عند طبقة الحوسبة.

تكييف LoRA أو QLoRA لنموذج بحجم 7 إلى 8 مليارات معامل يكلّف حاليًا بضعة دولارات من وقت وحدة معالجة الرسوميات، في حدود ساعتين إلى أربع ساعات على وحدة A100 مستأجرة. وتضع الأرقام المنشورة التشغيلة النموذجية عند 3 إلى 10 دولارات، مع إمكانية النزول تحت 3 دولارات على عتاد استهلاكي. أما المكافئات المُدارة فتكلّف عشرات الدولارات لا آلافها. وثمة مثال عملي متداول في أدبيات الممارسين لضبط QLoRA دقيق لنموذج Llama-3-8B على 8000 بند تعاقدي موسوم بلغ دقة 94.2% مقابل 92.8% لنموذج حدودي موجَّه على مجموعة التقييم نفسها، مقابل نحو 180 دولارًا من الإنفاق السحابي.

والتحفظ الصادق هو أن وحدة معالجة الرسوميات لم تعد هي النفقة. فمشاريع الضبط الدقيق الكاملة ما زالت تحط في نطاق 5000 إلى 15000 دولار، وذلك كله تقريبًا إعداد بيانات وتقييم. وهي طريقة أخرى للقول إن التكلفة متركزة في الشيء الذي يملكه الموردون الإقليميون أصلًا ولا يملكه منافسوهم العالميون.

أن تدع النموذج الكبير يعلّم الصغير

الأسلوب الثاني يهمّ أكثر من الضبط الدقيق لأي شخص يشغّل حجمًا كبيرًا، وله أدلة منشورة مباشرة بالعربية.

النمط هو التقطير مع إنسان في الحلقة. تستخدم نموذجًا حدوديًا مكلفًا كموسِّم لا كمصنِّف إنتاجي، وتجعل ناطقين أصليين يفصلون في الحالات التي يكون فيها النموذج غير واثق، وتدرّب نموذجًا صغيرًا رخيصًا على التسميات الناتجة. النموذج الحدودي يُستدعى آلاف المرات أثناء التطوير وصفر مرة في الإنتاج.

واقتصادات خطوة الوسم وحدها تستحق الذكر. فقد وضع بحث نُشر في مجلة PNAS في يوليو 2023 تكلفة الوسم بنموذج لغوي دون 0.003 دولار مقابل معيار بشري شائع الاستخدام قدره 0.11 دولار للتسمية، أي أرخص بنحو ثلاثين مرة، بينما تجاوز العمال الجماهيريين في الدقة بنحو 25 نقطة مئوية وتفوّق على العمال الجماهيريين والموسِّمين المدرَّبين معًا في اتفاق الموسِّمين. ووسمت دراسة تكرار من 2024 عبر أربع عشرة مهمة تصنيف ألف مثال تدريبي بأقل من 15 دولارًا. ضع ذلك مقابل تقدير الورقة نفسها لتشغيل النموذج الحدودي مباشرةً عبر مدوّنة من 6.2 مليون عنصر، والذي بلغ نحو 8990 دولارًا. الوسم هو الجزء الرخيص. والخدمة هي ما يكلّف مالًا.

وأجرت دراسة من سبتمبر 2025 على المشاعر العربية هذا التصميم بالضبط عبر ثلاث مجموعات بيانات تشمل الفصحى واللهجات، مستخدمةً GPT-4o وClaude وGemini وDeepSeek وLlama كموسِّمين. وعلى مجموعة بيانات Hunger Station، درّبت البيانات الموسومة بـ GPT-4o شبكة LSTM لتبلغ دقة 93% من 450 عيّنة موسومة فقط. وعلى مجموعة MASAC اللهجية، بلغت البيانات الموسومة بـ DeepSeek دقة 82% من 650 عيّنة، مطابِقةً ما حققه الوسم البشري.

أربعمئة وخمسون عيّنة. وشبكة LSTM، وهي قديمة معماريًا. تلك هي هيئة الفرصة: النموذج المكلف يقوم بالتعليم مرة واحدة، ونموذج صغير بما يكفي ليعمل على وحدة معالجة رسوميات متواضعة واحدة يقوم بالعمل إلى الأبد بعدها.

وليس ذلك العدد من العيّنات استثناءً. فقد وجدت دراسة من 2024 عبر مهام المشاعر والموقف والانفعال أن أداء المُرمِّز المضبوط دقيقًا يتشبّع بعد نحو 200 مثال، ما يضع النقطة المثلى العملية عند 200 إلى 500. واختيار أي الأمثلة تُوسَم يقلّص المتطلب أكثر: فقد خفّضت طريقة من نوفمبر 2025 العيّنات الموسومة من المعلّم بنسبة 71% على مدوّنة من خمس فئات بإنفاق ميزانية الوسم فقط على الحالات التي كان الطالب غير واثق منها.

والتقطير لا ينجح بالقدر نفسه على كل مهمة، وطريقة فشله محددة بما يكفي للتخطيط حولها. فقد أجرت تجارب FreeAL (مؤتمر EMNLP 2023) حلقة تقطير خالية من البشر تمامًا عبر عدة أنواع من المهام. وقد تفوّقت على الإشراف البشري الكامل في المشاعر الثنائية، مسجّلةً 95.91 مقابل 94.89 على SST-2. ثم انهارت في التصنيف الموضوعي السداسي، 79.80 مقابل 96.70، وفي استخراج الكيانات المسمّاة، 70.80 F1 مقابل 88.11. ومُسقَطًا على منتج استماع، فإن المشاعر والبريد المزعج آمنان للتقطير، بينما تحتاج التصنيفات الموضوعية الدقيقة واستخراج الكيانات إلى إبقاء البشر في الحلقة بحزم. والمورد الذي يقطّر كل شيء بشكل موحد سيشحن نموذج مشاعر أفضل من نموذجه القديم ونموذج موضوعات أسوأ بكثير.

وبالنسبة لمورد يملك عقدًا من المحادثة العربية الإنتاجية ومخططات فئات خاصة بالعملاء، فهذا برنامج عمل مباشر. عيّن عيّنة مقسّمة طبقيًا عبر اللهجات والقطاعات. وسّم بنموذج حدودي. وافصل في الذيل غير الواثق بالموسِّمين الناطقين أصليًا الذين توظفهم أصلًا. وقطّر إلى نموذج طالب صغير لكل صيغة لغوية، أو لكل عميل. واشحن مصنِّفًا هو لك فعلًا، وأفضل فعلًا على بياناتك، ورخيصًا بما يكفي لتشغيله على كل شيء.

كم يكلّف التصنيف فعلًا عند الحجم الكبير

يصبح سبب أهمية التقطير تجاريًا واضحًا بمجرد تسعير البديل. وهذا هو الحساب الذي يقرر ما إذا كان لمنتج استماع مبني على النماذج اللغوية هامش ربح إجمالي.

ضريبة الوحدات الرمزية العربية

قبل أي اختيار للنموذج، تكلّف العربية أكثر لكل وحدة معنى، لأن المجزّئات الرمزية فُصّلت على الإنجليزية.

مقاسًا على مجزّئ o200k_base الحالي من OpenAI مقابل مفردات مرجّحة بالتكرار من مدوّنة OpenSubtitles، تعمل الإنجليزية عند 1.16 وحدة رمزية للكلمة والعربية عند 1.97. أي عبء إضافي قدره 70% على المحتوى نفسه، يُحتسب على كل وحدة رمزية مُدخَلة، إلى الأبد. وكانت المجزّئات الأقدم أسوأ بكثير، وعبر المجزّئات الأصلية للنماذج عمومًا تقع العربية عند نحو 2.4 وحدة رمزية للكلمة مقابل 1.5 إلى 1.6 للإنجليزية.

فالمنشور المكوّن من 30 كلمة الذي يكلّف منافسك الناطق بالإنجليزية نحو 35 وحدة رمزية يكلّفك أنت نحو 59. وكل رقم تكلفة أدناه يحمل تلك الغرامة أصلًا، وهي عيب بنيوي على المشغّلين في السوق العربية لا يتحدث عنه أحد في الفئة.

التكلفة لكل مليون منشور

خذ عبء عمل ملموسًا. مليون إشارة عربية شهريًا، وهو ما يعادل علامة تجارية متوسطة السوق أو محفظة وكالة صغيرة، وأقل بكثير من الخمسين مليونًا التي تذكرها dima لمستواها المؤسسي. ولكل منشور تريد المشاعر والموضوع والنية في استدعاء مهيكل واحد.

لكل منشور، ذلك نحو 60 وحدة رمزية من المحتوى، وكتلة تعليمات من 400 وحدة رمزية تحمل تعريف المهمة وتصنيف التسميات، و30 وحدة رمزية من المخرجات المهيكلة. وعبر مليون منشور: 460 مليون وحدة رمزية مُدخَلة (منها 400 مليون هي كتلة التعليمات المكررة نفسها) و30 مليون وحدة رمزية مُخرَجة.

الأسعار أدناه لكل مليون وحدة رمزية، مأخوذة من صفحات تسعير المزودين في 31 يوليو 2026. «مُخزَّن مؤقتًا» يطبّق معدل التخزين المؤقت للتوجيه لدى المزود على كتلة التعليمات المكررة. و«مُخزَّن + دفعي» يضيف خصم الدفعات غير المتزامنة البالغ 50% الذي تقدمه OpenAI وGoogle وAnthropic جميعًا.

النموذجمُدخَل / مُخرَج لكل مليون وحدةبلا تحسينمُخزَّنمُخزَّن + دفعي
Mistral-Nemo 12B (DeepInfra)$0.019 / $0.03$9.64$9.64$4.82
Llama 3.1 8B (DeepInfra)$0.02 / $0.04$10.40$10.40$5.20
gpt-5-nano$0.05 / $0.40$35.00$17.00$8.50
Gemini 2.5 Flash-Lite$0.10 / $0.40$58.00$58.00$29.00
Gemini 3.1 Flash-Lite$0.25 / $1.50$160.00$70.00$35.00
gpt-5-mini$0.25 / $2.00$175.00$85.00$42.50
Claude Haiku 4.5$1.00 / $5.00$610.00$250.00$125.00
gpt-5$1.25 / $10.00$875.00$425.00$212.50
Claude Sonnet 5 (سعر تعريفي)$2.00 / $10.00$1,220.00$500.00$250.00
Claude Opus 5$5.00 / $25.00$3,050.00$1,250.00$625.00

تحفظان على قراءة ذلك الجدول. Sonnet 5 معروض بسعره التعريفي، الساري حتى 31 أغسطس 2026 قبل أن يعود إلى 3.00 و15.00 دولار. كما أن الأسعار لكل وحدة رمزية ليست قابلة للمقارنة بدقة عبر المزودين، لأن المجزّئات تختلف: فرقم الستين وحدة رمزية للمنشور مأخوذ من مجزّئ OpenAI، وعدة عائلات نماذج حالية تقسّم النص العربي نفسه إلى وحدات أكثر من ذلك بفارق ملموس. تعامل مع المقارنات بين المزودين كإرشادية وقِس على حركتك أنت قبل الالتزام.

اقرأ الطرفين. تصنيف مليون منشور عربي يكلّف 4.82 دولار على نموذج مفتوح الأوزان بحجم 12B بالدفعات و3050 دولارًا على نموذج حدودي مستخدَم بإهمال. أي فارق يزيد على 600 ضعف للعمل نفسه. اختيار النموذج ونظافة الطلبات هما الهامش كله.

ثلاث ملاحظات تتبع من الجدول.

أولًا، التخزين المؤقت للتوجيه هو أكبر رافعة منفردة لأي مستخدم لنموذج مملوك، لأن أعباء عمل التصنيف هي بادئة مكررة خالصة تقريبًا. كتلة التعليمات هي 87% من وحداتك الرمزية المُدخَلة وهي مطابقة بايتًا ببايت في كل استدعاء. وتخزينها مؤقتًا يقلّص فاتورة gpt-5-nano بنسبة 51% وفاتورة Claude Haiku بنسبة 59%. أما النقاط الطرفية مفتوحة الأوزان التي تسعّر المُدخَل بسنتين لكل مليون فلا تستفيد إلا بالكاد، لأنه لم يبقَ شيء ذو معنى ليُوفَّر.

ثانيًا، الدفعات مال مجاني لهذا العبء. فتصنيف الاستماع الاجتماعي ليس حساسًا لزمن الاستجابة. لا أحد ينتظر بلاطة في لوحة معلومات. وتشغيل مرور التصنيف بشكل غير متزامن ينصّف الفاتورة لدى كل مزود رئيسي، والتكلفة الوحيدة نافذة معالجة تُقاس بالساعات.

ثالثًا، الطبقة الحدودية غير قابلة للدفاع عنها كمصنِّف بالجملة وممتازة كمعلّم. فـ Opus 5 عند 625 دولارًا لكل مليون منشور حتى مع التحسين الكامل ليس مصنِّفًا إنتاجيًا لهذا العبء. أما استخدامه لوسم 20 ألف مثال تدريبي مرة واحدة فيكلّف خطأ تقريب وينتج أصلًا تحتفظ به.

التتالي

النمط الذي يسقط من الجدول هو التتالي. مرّر كل شيء عبر أرخص نموذج كافٍ. واجعله يُصدر إشارة ثقة. وصعّد فقط الجزء غير الواثق إلى شيء أقوى، ووجّه البقية إلى مراجعة بشرية.

إن تعامل نموذج صغير مُقطَّر مع 90% من الحركة بثقة عند 5 دولارات لكل مليون وصعّدت الـ 10% الباقية إلى gpt-5-mini عند 42.50 دولارًا لكل مليون، فإن تكلفتك المخلوطة تبلغ نحو 8.75 دولارًا لكل مليون منشور، وتكون الجودة على الحالات الصعبة أفضل مما كان النموذج الرخيص وحده ليقدمه. والذيل غير الواثق هو أيضًا، وبشكل مريح، مجموعة تدريبك التالية.

متى تكون الاستضافة الذاتية منطقية

سيسأل الموردون الإقليميون ذوو التزامات إقامة البيانات عن تشغيل استدلالهم الخاص، فتستحق نقطة التعادل ذكرًا صريحًا.

وحدة A100 بسعة 80 جيجابايت مخصصة تكلّف نحو 0.89 دولار في الساعة على DeepInfra، أي نحو 641 دولارًا شهريًا عند استخدام كامل الوقت. ومقابل 10.40 دولار لكل مليون منشور على نقطة طرفية مستضافة بحجم 8B، على تلك الوحدة أن تعالج نحو 62 مليون منشور شهريًا قبل أن تتعادل، وذلك بافتراض إبقائها مشبعة على مدار الساعة. ووحدة H100 عند 2.20 دولار في الساعة تحتاج نحو 152 مليونًا. ووحدة H100 من Baseten عند 6.50 دولار في الساعة تحتاج نحو 450 مليونًا.

تعامل مع كل تلك الأرقام كتابعة للتهيئة لا كمستقرة. فالقياسات المنشورة لتكلفة استدلال النماذج الصغيرة لكل مليون مستند تتفاوت بنحو خمسين ضعفًا بسبب الخيارات الهندسية وحدها: جيل العتاد، وحجم الدفعة، وطول التسلسل، وما إذا كانت طبقة الخدمة تحشو الدفعات أم تحزمها. والمنشورات الاجتماعية متفاوتة الأطوال بشدة، فهدر الحشو هو الشيء المحدد الذي يجب مراقبته. وأي رقم منفرد للتكلفة لكل مليون، بما في ذلك الأرقام أعلاه، يصف إعدادًا لا نموذجًا.

وبالنسبة لمورد عند الحجم المؤسسي الذي تذكره dima وهو 50 مليون إشارة، تقع الاستضافة الذاتية تقريبًا عند خط التعادل على الحوسبة الصافية وتحته بوضوح بمجرد احتساب المهندسين. وما يبرر الاستضافة الذاتية هنا هو السيادة، وللسعر علاقة ضئيلة جدًا بالأمر. فعقد حكومي سعودي يشترط بقاء الاستدلال داخل المملكة سبب تجاري لتشغيل وحداتك الخاصة، والعلاوة التي تدفعها مقابل ذلك تنتمي إلى تكلفة البيع. وهو ما يعود بنا إلى النقطة حول موضع الخندق المتبقي فعلًا.

أسئلة لطرحها على المورد

إن كنت تشتري في هذه الفئة، فرقم الدقة على الصفحة الرئيسية ليس معطى. وهذه الأسئلة تحوّله إلى معطى.

  • على أي مهمة يُقاس رقم دقتكم؟ المشاعر الثنائية والمشاعر الثلاثية والتعرّف على اللهجة على مستوى الدولة والتصنيف الموضوعي مشكلات شديدة الاختلاف بسقوف قابلة للتحقيق شديدة الاختلاف. والمورد الذي لا يستطيع الإجابة عن هذا في جملة واحدة يقتبس رقمًا لم يولّده هو.
  • ما حجم مجموعة الاختبار، ومن وسّمها؟ اطلب رقم اتفاق الموسِّمين. فإن كان هناك موسِّم واحد، فلا يوجد رقم اتفاق، ورقم الدقة هو اتفاق مع رأي شخص واحد.
  • أروني التفصيل حسب اللهجة. الدقة الإجمالية تخفي كل شيء. فالنموذج الممتاز على المصرية واليائس على المغاربية سيبلّغ متوسطًا جيدًا إن كانت مجموعة الاختبار مصرية في معظمها.
  • ماذا يحدث على لهجة لم تدرّبوا عليها؟ هل يتدهور، أم يمتنع، أم يعيد إجابة خاطئة واثقة؟ السلوك الثالث هو الخطير وهو السلوك الافتراضي.
  • هل المصنِّف ملكي أم مشترك؟ إن كان تصنيفك يُطبَّق بنموذج مدرَّب على بياناتك، فاسأل هل يخدم ذلك النموذج عملاء آخرين. وإن كان مصنِّفًا عامًا مع تسمياتك مسقَطة عليه، فأنت تشتري أقل مما تظن.
  • مرّروا بياناتي عبره أثناء التجربة. خذ 500 منشور من تدفقك أنت، واجعل اثنين من الناطقين بالعربية لديك يوسّمانها بشكل مستقل، وقِس اتفاقهما مع بعضهما أولًا، ثم قِس المنصة مقابلهما. واجعلهما يوسّمان قبل رؤية أي مخرجات للمنصة: فالموسِّمون الذين يُعرض عليهم تخمين نموذج يرتكزون إليه، وستأتي النتيجة مجاملةً للمورد. ساعتان من العمل ستخبرانك أكثر من أي عرض توضيحي.
  • ما موقفكم من النماذج تحت الغطاء؟ مضبوطة دقيقًا داخليًا، أم واجهة نموذج حدودي موجَّه، أم مزيج. لا توجد إجابة خاطئة، لكن المورد الذي يرفض القول عادةً ما يعيد بيع استدعاء واجهة برمجية بسعر نموذج مملوك.

ماذا يعني هذا للموردين

المنصات الإقليمية في موقع أفضل مما قد توحي به هذه المقالة، شريطة أن تكفّ عن الدفاع عن الأصل الخطأ.

لعرض فهم اللهجات ربما عام واحد من العمر في الغرف التي لم يختبر فيها المشتري البديل، وهو ميت أصلًا في الغرف التي اختبره فيها. والاستمرار في التصدّر به يستدعي المقارنة نفسها التي تسير سيرًا سيئًا، لأن المشتري يستطيع إجراء تلك المقارنة بنفسه في متصفح مجانًا.

وما يحملونه بدلًا من ذلك يد قوية فعلًا. وصول إلى بيانات لا يستطيع منافس شراءها. ومكانة في الإقامة والمشتريات لا تستطيع منصة مستضافة في الولايات المتحدة الحصول عليها. والأثمن من ذلك كله، عقد من المحادثة العربية الموسومة يحمل تصنيفات عملاء حقيقية، وهي المُدخَل الوحيد الذي تجعله اقتصادات الذكاء الاصطناعي الحالية مكلفًا بينما تجعل كل شيء آخر رخيصًا. والحوسبة اللازمة لتحويل تلك المدوّنة إلى مصنِّفات مكيَّفة ومقطَّرة لكل عميل تكلّف أقل من حاسوب محمول. والمدوّنة هي الجزء الذي استغرق عشر سنوات.

والموردون الذين سيخرجون من هذا بخير هم من يكفّون عن بيع قدرة لغوية صار بإمكان المشتري التحقق منها في أربع ثوانٍ، ويبدأون في بيع قدرة تصنيف لا يستطيع المشتري إعادة إنتاجها لأنه لا يملك البيانات. وتلك قصة أصعب في وضعها على صفحة رئيسية. وهي أيضًا صحيحة، وهو ما ليست عليه نسبة الـ 97%.

المصدر الرقم المُبلَّغ المهمة كما ذُكرت مجموعة اختبار عامة
dima (thedar.ai) دقة 97% كل اللهجات والعامية والفرانكو آراب (غير محددة) لا
AIM Insights دقة 92% المشاعر العربية (غير محددة) لا
Lucidya دقة تتجاوز 92% العربية (غير محددة) لا
Crowd Analyzer دقة 91% أكثر من 176 لغة (غير محددة) لا
النظام الفائز في NADI 2024 50.57 متوسط F1 كلي التعرّف متعدد التسميات على اللهجة على مستوى الدولة نعم
النظام الفائز في NADI 2024 20.44 BLEU الترجمة من اللهجة العربية إلى الفصحى الحديثة نعم
أفضل نموذج على اللهجة التونسية، نوفمبر 2025 دقة 0.60، متوسط F1 كلي 0.45 مشاعر اللهجة التونسية نعم
الموسِّمون البشر، الأدبيات المنشورة اتفاق 70-80% مشاعر وسائل التواصل الثنائية أو الثلاثية متنوعة

الأسئلة الشائعة

هل تستطيع النماذج اللغوية عامة الغرض التعامل فعلًا مع اللهجات العربية الآن؟
بالنسبة للهجات وفيرة الموارد، نعم. فالمصرية والشامية والخليجية تهيمن على حجم وسائل التواصل، ونموذج حدودي بتوجيه جيد يتعامل معها باقتدار. أما الصيغ شحيحة الموارد فقصة أخرى: فقد وجد معيار من نوفمبر 2025 على اللهجة التونسية أفضل نموذج يبلغ دقة 0.60 ومتوسط F1 كليًّا قدره 0.45 على المشاعر. كما يُظهر البحث باستمرار أن النماذج الأصغر المضبوطة دقيقًا على العربية تتفوق على النماذج العامة الموجَّهة في مهام التصنيف الضيقة.
لماذا يثير ادعاء الدقة بنسبة 97% الريبة؟
لأنه لا يحدد أي مهمة. فأفضل نظام مُقاس علنًا للتعرّف على اللهجة العربية على مستوى الدولة سجّل 50.57 من متوسط F1 الكلي في مسابقة NADI 2024. وبشكل منفصل، لا يتفق الموسِّمون البشر الذين يصنّفون المشاعر الاجتماعية فيما بينهم إلا بنسبة 70 إلى 80 بالمئة، وهو ما يحدّ ما يمكن لأي مقارنة بمعيار ذهبي أن تبلّغه بشكل ذي معنى. ورقم 97% يشير عادةً إلى مجموعة اختبار صغيرة، أو موسِّم واحد، أو مهمة اختُزلت إلى فئتين سهلتين.
كم يكلّف تصنيف منشورات وسائل التواصل بنموذج لغوي كبير؟
لمليون منشور عربي شهريًا مع المشاعر والموضوع والنية لكل منشور، تتراوح التكاليف بين نحو 4.82 دولار على نموذج مفتوح الأوزان بحجم 12B بالدفعات ونحو 3050 دولارًا على نموذج حدودي يُستخدم دون تخزين مؤقت أو دفعات. والتخزين المؤقت للتوجيه هو أكبر رافعة لأن كتلة التعليمات تمثل نحو 87% من الوحدات الرمزية المُدخَلة وهي مطابقة في كل استدعاء. وخصم الدفعات غير المتزامنة البالغ 50% شبه مجاني لهذا العبء لأن التصنيف ليس حساسًا لزمن الاستجابة.
لماذا تكلّف معالجة العربية أكثر من الإنجليزية؟
لأن المجزّئات الرمزية فُصّلت على الإنجليزية. فعلى مجزّئ o200k_base الحالي من OpenAI، تعمل الإنجليزية عند 1.16 وحدة رمزية للكلمة والعربية عند 1.97، أي عبء إضافي قدره 70% على المحتوى نفسه يُحتسب على كل وحدة رمزية مُدخَلة. وعبر المجزّئات الأصلية للنماذج عمومًا، تقع العربية عند نحو 2.4 وحدة رمزية للكلمة مقابل 1.5 إلى 1.6 للإنجليزية.
هل ينبغي لمورد استماع أن يضبط نماذجه الخاصة دقيقًا؟
الحوسبة شبه مجانية: فتكييف LoRA أو QLoRA لنموذج بحجم 7-8 مليارات معامل يكلّف بضعة دولارات من وقت وحدة معالجة الرسوميات. والنفقة الحقيقية هي إعداد البيانات والتقييم، ما يضع المشاريع الكاملة في نطاق 5000 إلى 15000 دولار. وبنية التكلفة تلك تخدم أي مورد يملك أصلًا مدوّنة موسومة كبيرة، وهو بالضبط ما تملكه المنصات العربية الإقليمية ولا يملكه منافسوها العالميون.
هل الاستضافة الذاتية للاستدلال أرخص من الدفع لكل وحدة رمزية؟
نادرًا، على أساس الاقتصاد وحده. فوحدة A100 بسعة 80 جيجابايت مخصصة بنحو 0.89 دولار في الساعة تكلّف نحو 641 دولارًا شهريًا عند الاستخدام الكامل، وهو ما يحتاج نحو 62 مليون منشور شهريًا للتفوق على نقطة طرفية مستضافة بحجم 8B عند 10.40 دولار لكل مليون. والسبب الحقيقي للاستضافة الذاتية هو إقامة البيانات: فالعقود التي تشترط بقاء الاستدلال داخل ولاية قضائية بعينها تجعله تكلفة بيع لا عدم كفاءة.
ما الذي ما زال يميّز منصات الاستماع الإقليمية؟
الوصول إلى البيانات قبل كل شيء، وخصوصًا تغطية Snapchat وTikTok في الخليج إضافة إلى الصحافة المطبوعة والتلفزيون والإذاعة العربية عبر المنطقة، وهو ما لا يستطيع منافس تكراره عن بُعد. ثم إقامة البيانات والمكانة في مشتريات القطاع العام، والواجهات العربية من اليمين إلى اليسار مع دعم باللغة المحلية، وسرعة التهيئة. وهذه مزايا توزيع وتشغيل لا مزايا تقنية، وهو ما يهمّ لأنها لا تدعم علاوة سعرية تقنية.

المصادر

Strategy للمؤسسات مدعوم بالذكاء الاصطناعي الشرق الأوسط وشمال أفريقيا
شارك:

مقالات ذات صلة