في 31 يوليو 2026، نشرت DeepSeek نموذج DeepSeek-V4-Flash-0731 على Hugging Face ونقلت واجهة V4-Flash الرسمية إلى مرحلة البيتا العامة. بطاقة النموذج صريحة بشأن ما تغيّر: لا شيء على مستوى البنية. نفس نموذج المزج المتفرق للخبراء بحجم 284 مليار معامل. نفس الـ 13 مليار معامل نشط لكل توكن. نفس نافذة السياق البالغة مليون توكن. القفزة كلها ناتجة عن إعادة التدريب اللاحق.
والقفزة ليست صغيرة. ارتفع Terminal Bench 2.1 من 61.8 في نسخة المعاينة إلى 82.7. وقفز DeepSWE من 7.3 إلى 54.4. وتضاعف Cybergym تقريبًا، من 38.7 إلى 76.7.
وبقي السعر عند 0.14 دولار لكل مليون توكن إدخال و0.28 دولار لكل مليون توكن إخراج.
هذا المزيج — نتائج وكيلية قريبة من Opus بجزء ضئيل من أسعار النماذج الرائدة — هو الخبر الحقيقي. ليس لأن DeepSeek فازت بشيء، بل بسبب ما يعنيه ذلك حول موقع المنافسة المثيرة للاهتمام في 2026.
الأرقام، مع التحفّظ أولًا
ملاحظات الإصدار من DeepSeek نفسها تحمل تحذيرًا أغفلته معظم التغطيات: جميع أرقام القياس معلنة من المورّد وعلى إطار اختبار غير منشور. شغّل تقييماتك الخاصة قبل توجيه حركة إنتاج حقيقية. وبعد توضيح ذلك، إليك ما يدّعيه المورّد:
| المعيار | 0731 | المعاينة | التغيّر |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | +34% |
| NL2Repo | 54.2 | 39.4 | +38% |
| Cybergym | 76.7 | 38.7 | +98% |
| DeepSWE | 54.4 | 7.3 | +645% |
| Toolathlon-Verified | 70.3 | 49.7 | +41% |
للسياق الخارجي: على Terminal Bench 2.1 يسجل 0731 نتيجة 82.7 مقابل 81.0 لـ GLM-5.2 و85.0 لـ Claude Opus 4.8. وتضعه Artificial Analysis عند 50 على مؤشر الذكاء لديها — المرتبة الثالثة من بين 101 نموذج، مقابل وسيط قدره 25 للنماذج المماثلة.
سطر DeepSWE هو الذي يستحق التوقف عنده. القفز من 7.3 إلى 54.4 بنفس فئة الأوزان ليس تعديلًا طفيفًا؛ بل يعني أن نسخة المعاينة كانت معطّلة فعليًا في مهام هندسة البرمجيات طويلة الأمد، وأن إعادة التدريب أصلحت شيئًا بنيويًا في طريقة تخطيط النموذج وتعافيه. تعامل مع فروق بهذا الحجم في معيار واحد كإشارة للتحقق لا كإشارة للاحتفال.
تحفّظ إضافي من تشغيل Artificial Analysis: هذا نموذج استدلالي، ومُسهب. أنتج 210 مليون توكن إخراج خلال تقييم مؤشر الذكاء مقابل وسيط قدره 100 مليون. بسعر 0.28 دولار للمليون يبقى رخيصًا — لكن تكلفتك الفعلية لكل مهمة تحكمها توكنات الإخراج لا السعر المعلن. خطّط ميزانيتك على هذا الأساس.
ما الذي تغيّر فعليًا تحت الغطاء
البنية لم تتغير عن المعاينة، ما يجعل من المفيد إعادة ذكرها لمن ينوي نشرها:
- 284 مليار معامل إجمالي، نحو 13 مليار نشط لكل توكن. يختار الموجّه أفضل 6 من 256 خبيرًا موجّهًا في كل طبقة، إضافة إلى خبير مشترك واحد.
- انتباه هجين — تصفه DeepSeek بأنه Compressed Sparse إضافة إلى Heavily Compressed Attention، وهو ما يجعل سياق المليون توكن قابلًا للمعالجة.
- دقة مختلطة أصلية — FP4 لخبراء MoE وFP8 للطبقات الكثيفة.
- رخصة MIT ومستودع مفتوح دون بوابة. النشر التجاري والتعديل والضبط الدقيق مسموح بها دون اتفاقية منفصلة.
- أقصى إخراج: 384,000 توكن.
رخصة MIT على مستودع غير مقيّد هي الجزء الأهم استراتيجيًا. لا استمارة طلب، ولا شروط استخدام مقيّدة، ولا تفاوض على التراخيص. بالنسبة لفريق في تونس أو الرياض يقيّم ما إذا كان بإمكانه قانونيًا شحن نسخة مضبوطة داخل منتج لعميل، هذا يزيل العائق الأكثر شيوعًا في تبنّي النماذج مفتوحة الأوزان.
كما تشحن DeepSeek وحدة DSpark لفك التشفير التخميني، وتفيد بتسريع التوليد لكل مستخدم بنسبة 60–85% عند إنتاجية مماثلة. الإعدادات الموصى بها للاستخدام الوكيلي هي temperature = 1.0, top_p = 0.95 — وهي قيم مرتفعة نسبيًا، ويُستحسن احترامها بدل خفضها تلقائيًا، لأن التدريب اللاحق ضُبط عليها.
واجهة البرمجة تغيّرت أكثر من النموذج
التحديث الأهدأ: صار v4-flash يدعم أصلًا صيغة Responses API وجرى تكييفه لـ Codex. أما V4-Pro ونماذج الويب فلم تحصل على شيء.
هذه خطوة تموضع مقصودة. بدل مطالبة المطورين بإعادة كتابة إطار عملهم حول واجهة على مقاس DeepSeek، تكيّفت DeepSeek مع الشكل الذي تبني عليه الفرق أصلًا. إذا كانت حلقة الوكيل لديك مكتوبة بالفعل لصيغة Responses، فتكلفة الانتقال هي عنوان أساسي ومفتاح.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.deepseek.com/v1",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const response = await client.responses.create({
model: "deepseek-v4-flash-0731",
input: "دقّق هذا المستودع بحثًا عن وعود غير معالجة وافتح طلب دمج.",
temperature: 1.0,
top_p: 0.95,
});سقف التزامن في البيتا هو 2,500 طلب. كافٍ لمعظم أساطيل الوكلاء الإنتاجية، لكنه قيد حقيقي إذا كنت تشغّل مهام تقييم دفعية كبيرة.
حسابات التسعير التي تحسم القرار فعلًا
هنا يثبت رقم إصابة الذاكرة المؤقتة جدواه. التسعير الرسمي لـ 0731 لكل مليون توكن:
- إدخال مع إصابة الذاكرة المؤقتة: 0.0028 دولار
- إدخال دون إصابة: 0.14 دولار
- إخراج: 0.28 دولار
صنّفته Artificial Analysis في المرتبة الأولى من بين 101 نموذج على تسعير إصابة الذاكرة المؤقتة. هذا الخصم البالغ 98% ليس زينة تسويقية — بل هو الحجة الاقتصادية بأكملها في أحمال الوكلاء.
تخيّل وكيل مراجعة كود يقرأ سياق مستودع بحجم 200 ألف توكن في كل استدعاء وينتج نحو 4 آلاف توكن مراجعة. شغّله 500 مرة يوميًا:
دون تخزين مؤقت للبادئة: 100 مليون توكن إدخال بسعر 0.14 دولار = 14.00 دولار، إضافة إلى 2 مليون إخراج بسعر 0.28 دولار = 0.56 دولار. أي نحو 14.56 دولار يوميًا.
مع تخزين مؤقت للبادئة على سياق المستودع: الجزء الأكبر من ذلك الإدخال يصيب الذاكرة المؤقتة بسعر 0.0028 دولار للمليون. نفس الحمل يهبط إلى نحو 0.85 دولار يوميًا.
نفس النموذج، نفس الإخراج، فارق يقارب 17 ضعفًا — يحسمه بالكامل ما إذا كنت قد رتّبت مطالباتك بحيث يقع السياق الثابت في المقدمة والجزء المتغير في النهاية. هذا هو التغيير الأعلى مردودًا والذي لم تجرِه معظم الفرق بعد. وقد تناولنا آلياته بالتفصيل في دليلنا حول تحسين تكلفة واجهات الذكاء الاصطناعي عبر التخزين المؤقت وتوجيه النماذج.
الاستضافة الذاتية: اقرأ أرقام الذاكرة قبل التخطيط
رخصة MIT تجعل الاستضافة الذاتية قانونية. لكنها لا تجعلها سهلة.
284 مليار معامل بالدقة المختلطة المشحونة تعني نحو 140 غيغابايت من الأوزان. ومع تكميم مكثّف تبقى في نطاق 70–80 غيغابايت. وتوجيهات DeepSeek نفسها تضع التكميم ثلاثي البتات عند نحو 110 غيغابايت من الذاكرة، أو عقدة 4×GB300 للدقة الكاملة.
بالترجمة: هذه عتاد خوادم متعدد المعالجات الرسومية، لا محطة عمل. الحماس المتداول على منصة إكس حول كونه "قابلًا للتشغيل محليًا" صحيح فقط إذا كان تعريفك للمحلي يشمل خزانة خوادم. كل من vLLM وSGLang يدعمان النموذج مع توازي الخبراء ونواة الانتباه الهجين، فالمسار البرمجي نظيف — أما المسار الرأسمالي فلا.
بالنسبة لمعظم الفرق، الإجابة الصادقة هي: استخدم الواجهة، واحتفظ بالاستضافة الذاتية كورقة تفاوض وكإجابة عن إقامة البيانات. رخصة MIT تعني أن بإمكانك الانتقال إن احتجت، ولهذا الخيار قيمة حتى لو لم تستخدمه أبدًا. وإذا كانت السيادة هي الدافع الحقيقي بدل التكلفة، فمقالنا حول السيادة الرقمية والسحابة السيادية في إفريقيا والشرق الأوسط يعالج هذا القرار كما ينبغي.
لماذا صارت الفئة الاقتصادية هي السباق المثير
الفئة الرائدة ما زالت تتحرك — فـ Opus 4.8 يعلو 0731 على Terminal Bench، وGPT-5.6 خفّض أسعاره بشدة مؤخرًا من تلقاء نفسه. لكن الفجوة بين أفضل نموذج ونموذج يكلّف جزءًا من خمسين من سعره تقلّصت خلال العام الماضي أسرع مما تقدّمت به الجبهة الأمامية.
بالنسبة لمن يبني وكلاء، هذا يغيّر شكل المسألة التصميمية. حين كانت الفئة الرخيصة ضعيفة فعلًا، كانت البنية تعني اختيار أقوى نموذج تستطيع تحمّله وتقليل الاستدعاءات. وحين تقترب الفئة الرخيصة من الجبهة الأمامية بنقاط قليلة في مهمتك الفعلية، تصبح البنية تعني التوجيه: نموذج كفؤ ورخيص يتولى المسار عالي الحجم، ونموذج رائد محجوز للنسبة الصغيرة من الخطوات التي تحتاجه حقًا.
شكل عملي يصلح اليوم:
- قِس على مهمتك أنت، لا على مهمتهم. خذ 50 أثرًا حقيقيًا من وكيلك الإنتاجي. مرّرها عبر 0731 ونموذجك الحالي. قارن معدل الإنجاز والتكلفة الإجمالية، لا نتائج المعايير.
- وجّه حسب الخطوة لا حسب الحمل. قراءة الملفات وتشغيل الاختبارات وإصلاحات التنسيق وإرسال الأدوات تذهب إلى Flash. أما القرارات المعمارية وحل المتطلبات الغامضة فتُصعّد.
- رتّب المطالبات لإصابة الذاكرة المؤقتة. السياق الثابت أولًا، والمتغير أخيرًا. هذا أثمن من اختيار النموذج نفسه.
- احتفظ بخطة بديلة. واجهات البيتا لها موثوقية البيتا. التعدد في النماذج ليس ارتيابًا في هذه المرحلة — راجع مرونة الموردين واستراتيجية التعدد النموذجي.
ماذا يعني هذا لفرق الشرق الأوسط وشمال إفريقيا
أمران تحديدًا.
كانت تكلفة التوكنات السقف الصامت أمام تبنّي الوكلاء في المنطقة. سير عمل يكلّف 400 دولار شهريًا في الاستدلال قرار سهل في سان فرانسيسكو وصعب في تونس أو الدار البيضاء. نماذج في هذه الشريحة السعرية والقدراتية تنقل مجموعة معتبرة من مشاريع الأتمتة من خانة "مثير للاهتمام، لاحقًا" إلى "قابل للتمويل الآن".
كما أن رخصة MIT تزيل نقاش الامتثال الذي يعطّل عادة تبنّي النماذج مفتوحة الأوزان في القطاعات المنظّمة. البنوك والصحة وعملاء القطاع العام الذين لا يمكنهم إرسال بيانات إلى واجهة مستضافة في الولايات المتحدة صار أمامهم مسار لا يتطلب اتفاقية مورّد مفصّلة — شرط أن يكون أحدهم قد رصد ميزانية العتاد.
الخلاصة الصادقة
DeepSeek-V4-Flash-0731 هو نقطة تدقيق أُعيد تدريبها لاحقًا، بمعايير معلنة من المورّد، ورخصة متساهلة فعلًا، وتسعير ذاكرة مؤقتة عدواني، ومتطلبات عتاد حقيقية إن أردت تشغيله بنفسك. ليس نموذجًا رائدًا ولا يدّعي ذلك.
لكنه دليل قوي على أن السؤال المفيد في 2026 لم يعد "أي نموذج هو الأذكى" بل "ما أرخص نموذج يتجاوز العتبة لهذه الخطوة تحديدًا". شغّل التقييم على آثارك أنت. الإجابة الخاصة بحملك ستكون أكثر إفادة من أي لوحة تصنيف.
تبني تدفقات عمل وكيلية وتريد لنموذج التكلفة أن يصمد في الإنتاج؟ نقطة تساعد الفرق في تونس والخليج على تصميم أنظمة ذكاء اصطناعي تُشحن فعلًا — وتبقى ميسورة عند التوسّع.