
Grok 4.6 وGemini 3.7 Flash وGLM-5.3 وDeepSeek V4 Pro 0813 كلها شُحنت خلال نفس الأسبوعين. Grok Bot من xAI ومنظومة Buzz/Berd من Block كلاهما يدفعان الوكلاء من "أداة تستدعيها" إلى "زميل بحاسوب خاص". بالإضافة إلى أوزان مفتوحة تهبط بكل حجم من 2.6 مليار إلى 2.4 تريليون، مقارنة صوتية عربية جديدة، ومنظومة المراقبة التي تحتاجها قبل أن يصل أي من هذا إلى عميل.
انتهت الجولة الماضية بمنحنى: تسليع القدرة وتحوّل القدرة إلى خطيرة ليسا قصتين منفصلتين، بل نفس الخط. هذه الجولة هي شكل ذلك المنحنى وهو يتحرك بسرعة في كل اتجاه في آن واحد. في ستة عشر يوماً، حدّثت أربعة مختبرات — xAI وGoogle وZhipu وDeepSeek — موديلها الرائد أو القريب من الرائد. في نفس النافذة، شحنت شركتان مختلفتان تماماً نسختيهما من "الوكيل أصبح له مكتب الآن": Grok Bot من xAI يمنح كل وكيل حاسوبه السحابي الدائم الخاص، وBlock فتحت مصدر كلا نصفي مساحة عمل حيث يتشارك البشر والوكلاء نفس نظام الهوية.
تحت الإطلاقات العنوانية، استمرت القطع التي تُغيّر فعلياً كيف يبني فريق مثل Conneqt بالتحرك أيضاً — جولة جديدة من الأوزان المفتوحة صغيرة بما يكفي للاستضافة الذاتية على لابتوب، خيار ثانٍ حقيقي للتعرف على الكلام العربي، وأدوات المراقبة التي يحتاجها كل نشر من نشرات الوكلاء هذه قبل أن تلمس حساب عميل. هنا القراءة الكاملة لـ 4-20 أغسطس، وماذا تفعل بها فعلياً.
شحنت SpaceXAI موديل Grok 4.6 بتركيز أحدّ على الوكلاء طويلي التشغيل و"عمل تفاعلي وبصري أكثر طموحاً". سجّل 61 على Artificial Analysis Intelligence Index — ارتفاع 5 نقاط من Grok 4.5، مطابقاً لـ GPT-5.6 Sol، متأخراً بنقطتين عن أحدث موديل رائد لـ Claude — بينما أبقى الأسعار ثابتة عند $2/$6 لكل مليون رمز، لا تزال أرخص بأكثر من 60% من GPT-5.6 Sol. التحفظ: ادعاء "يطابق Sol" يصمد فقط على المركّب من تسعة معايير. على جدول xAI الخاص من عشرة صفوف، يتصدر موديل Claude الرائد معظم الصفوف صراحة، ويخسر Grok 4.6 أمام Terminal-Bench 3.0 بحوالي 8.6 نقطة أمام GPT-5.6 Sol — فجوة لم يذكرها نص منشور الإطلاق. Grok 4.6 أقوى في العمل المعرفي والمنطق القانوني، أضعف في استخدام الطرفية. لا يوجد تكرار مستقل من طرف ثالث بعد أسبوع من الإطلاق.
أسرع وتيرة إصدار لـ Google هذا العام: هبط Gemini 3.7 Flash بعد 23 يوماً فقط من 3.6 Flash، بدون تغيير معماري — تقول Google إن المكاسب جاءت بالكامل من تحسينات ما بعد التدريب الخوارزمية. قفز DeepSWE v1.1 من 49.0% إلى 65.3%؛ FrontierCode 1.1 Main من 34.4% إلى 43.6%؛ Elo على WebDev Arena من 1538 إلى 1588. السعر التمهيدي نصف سعر إطلاق 3.6 Flash. السياق المهم: Google لم تشحن بعد Gemini 3.5 Pro، الموعود في يونيو، والحديث في الصناعة ينسب جزئياً وتيرة تكرار فئة Flash السريعة إلى مغادرات مواهب AI داخلية. حي الآن في AI Studio وAndroid Studio وGoogle Antigravity ومنصة Gemini Enterprise Agent وSpark (الوكيل الشخصي الدائم لـ Google).
أطروحة Z.ai لهذا الإصدار صريحة: لا قاعدة موديل جديدة، لا معمارية أكبر — "توسيع ما بعد التدريب هو كل ما فعلناه لـ GLM-5.3." كل مكسب مُدَّعى، بما فيه قفزة مُبلَّغة بـ 50% فوق GLM-5.2، يأتي من طريقة التدريب فقط. ارتفع DeepSWE أكثر من عشرين نقطة إلى 66.9%؛ GDPval-AA v2 وصل إلى 1769، عند الإطلاق أفضل رقم منشور من أي مختبر موديل مفتوح. الجدة الحقيقية هي الأمن السيبراني: 84.5% على CyberGym تصدّر جدول إطلاق Z.ai الخاص صراحة، و54.4% على ExploitBench سجّل أعلى رقم عند وقت الإطلاق بين مختبرات الموديلات المفتوحة (رغم أن موديلات Anthropic وOpenAI الرائدة المغلقة لا تزال تتصدر هناك). خروج واحد عن نمط GLM-5.2 يستحق الإشارة: الأوزان المفتوحة ووصول API مُدرَجان خلف مراجعة أمان بدلاً من الشحن في نفس اليوم — متاح اليوم فقط عبر GLM Coding Plan وZCode.
بدون منشور مدونة، بدون بيان صحفي — حدّثت DeepSeek ببساطة سلسلة إصدار صفحة أسعارها من معاينة إلى DeepSeek-V4-Pro-0813، بعد أربعة أشهر من ظهور المعاينة في 24 أبريل. على منصة DeepSeek الخاصة، سجّل 87.9 على Terminal-Bench 2.1 (مقابل 72.1 لمعاينة أبريل)، 62.7 على DeepSWE، 61.5 على NL2Repo. بجانب التوفر العام، فتحت DeepSeek مصدر برمجية وكيلها الخاصة، DeepSeek Harness v0.1، تحت MIT — سجل جلسة مستمر، تشغيلات قابلة للاستئناف/التفريع/إعادة التشغيل، ووضع قشرة-وملف-محرر بسيط (الإعداد بالضبط الذي استخدمته DeepSeek لأرقام معاييرها الخاصة). الحاشية الأقل تغطية: قفزت الأسعار بشكل كبير في 16 أغسطس مع فوترة ذروة/خارج-الذروة جديدة — إخراج خارج الذروة يهبط عند حوالي 2.28× السعر القديم، الذروة عند 4.55×.
| الموديل | صدر | الإدخال/الإخراج ($/مليون) | الرقم العنواني |
|---|---|---|---|
| Grok 4.6 | 12 أغسطس | $2 / $6 | 61 على AA Intelligence Index |
| Gemini 3.7 Flash | 13 أغسطس | $0.75 / $3.75* | 65.3% DeepSWE v1.1 |
| GLM-5.3 | 14 أغسطس | طرح مرحلي | 84.5% CyberGym |
| DeepSeek V4 Pro 0813 | 12 أغسطس | $0.44 / $0.87←ارتفاع 16 | 87.9% Terminal-Bench 2.1 |
*سعر تمهيدي حتى 31 ديسمبر 2026
قطّرت Meta Superintelligence Labs موديل Muse Glimmer إلى حوالي 30 مليار باراميتر (29.6B كثيف + 1.8B مُشفِّر رؤية) من Muse Spark الأكبر، مبني تحديداً لـوكلاء محليين دائمي التشغيل — استدعاء دوال، برمجة، قراءة شاشة/وثائق، LLM-كحكم — على GPU Mac أو PC واحد. سياق 131K، أكثر من 100 لغة، يعمل مع OpenClaw جاهزاً. المعايير مختلطة فعلياً: يتصدر Qwen3.6-27B وGemma4-31B على MCP Atlas (75.5) والمنطق (AIME 2026: 94.7)، لكن يتأخر على OSWorld-Verified (65.9 مقابل 75.6 لـ Qwen) وTerminal-Bench 2.1 (60.7). استخدم الرئيس التنفيذي زوكربيرغ الإطلاق للضغط من أجل سياسة أمريكية أخف للمصدر المفتوح، مؤطراً إياه ضد المنافسة الصينية للأوزان المفتوحة.
بعد أربعة أيام من Muse Glimmer، فتحت Alibaba أوزان كل من Qwen3.8-Max بـ 2.4 تريليون باراميتر و، أكثر فائدة لمعظم الفرق، Qwen3.8-27B — موديل كثيف متعدد الوسائط بـ 27.78B (نص، صورة، فيديو) تحت Apache 2.0 بنافذة سياق 262K. على أرقام Qwen الخاصة، يتفوق على Muse Glimmer عبر كل المقارنات الثمانية المباشرة ويتفوق على Claude Opus 4.6 في 15 من 19 اختباراً متداخلاً: Terminal-Bench 2.1 من 63.4 إلى 73.0، DeepSWE 1.1 من 13.3 إلى 42.2، OSWorld-Verified من 63.9 إلى 84.3. يعمل على 24GB VRAM. كما هو الحال مع كل رقم مُبلَّغ ذاتياً في هذه الجولة، ينطبق تحفظ التقييم المُوحَّد — لكن هذا حالياً أقوى مرشح قابل للاستضافة محلياً للفرق التي تحتاج رؤية بالإضافة إلى برمجة وكيلية على محطة عمل واحدة.
أكملت Liquid AI عائلة على الجهاز عبر ثلاثة أسابيع: LFM2.5-2.6B (4 أغسطس) يفكك بـ 220 رمز/ث على Apple M5 Max و113 رمز/ث على CPU من Ryzen، تحت 2.5 جيجابايت ذاكرة، متفوقاً على موديلات حتى 4× حجمه على ToolSandbox واتباع التعليمات. LFM2.5-VL-3B (12 أغسطس) يقرن نفس العمود الفقري بمُشفِّر رؤية SigLIP2 لعمل رؤية-لغة بفئة الهاتف/اللابتوب — تأريض RefCOCO قفز حوالي 30 نقطة فوق الجيل السابق. كلاهما يُشحن تحت رخصة LFM Open مع دعم يوم-0 لـ llama.cpp وMLX وONNX.
تأطير xAI مباشر: كل Bot يحصل على حاسوبه السحابي الدائم الخاص، يسجّل دخول إلى أدواتك الحالية ببيانات اعتمادك الخاصة، ويعمل عبر مهام متعددة الخطوات دون إشراف، يظهر فقط عندما يحتاج موافقة. حالات استخدام xAI الداخلية (الآن أمثلة عامة): Bot مبيعات صادرة يبحث عن حسابات طوال الليل ويصف مسودات مخصصة، Bot جاهزية عرض يُصلح بيانات بذرة قديمة قبل مكالمات الصباح، Bots إعادة إنتاج أخطاء تُسلّم إلى Bots تصحيح أخطاء. مُدرَج في SuperGrok Heavy وCursor Ultra ($200/شهر) وCursor Teams Premium ($120/مقعد/شهر)؛ حي على سطح المكتب وiOS، المؤسسات على قائمة انتظار.
شحنت Anthropic ثلاث إضافات مركّزة على الحوكمة في نفس النافذة. ميزانيات الجلسة تضع سقف إنفاق صارم على أي جلسة Managed Agents — تصل إلى السقف وتتوقف بسبب توقف budget_reached بدلاً من الحرق بهدوء أكثر؛ قابلة للتعديل أو الإزالة للاستئناف. موديلات المستشار تتيح لخيط الجلسة الأساسي استشارة موديل منفصل، بقدرة لا تقل عن قدرته الخاصة، في منتصف الدور — رأي ثانٍ مدمج دون إعادة هيكلة حلقة الوكيل. التثبيت الجغرافي للاستنتاج والمهارات المُستضافة على GitHub يُكمِلان الإصدار، مانحين الفرق خيارات إقامة بيانات وتحكم إصدار حقيقية لأول مرة. بشكل منفصل: أسعار Sonnet 5 التمهيدية ($2/$10 لكل مليون رمز) أصبحت السعر القياسي الدائم في 10 أغسطس — الزيادة المُجدولة إلى $3/$15 لن تحدث.
Block — شركة جاك دورسي، خلف Square وCash App وTidal — أصدرت منتجين مفتوحي المصدر متكاملين في هذه الفترة، وشحنت Nous Research تكامل Hermes Agent الرسمي لكليهما.
Buzz مساحة عمل مفتوحة المصدر، قابلة للاستضافة الذاتية، مبنية على Nostr، البروتوكول اللامركزي الذي يمنح كل مشارك — بشري أو وكيل — زوج مفاتيح تشفير خاص به بدلاً من رمز بوت. تبدو كـ Slack (قنوات، رسائل مباشرة، خيوط، تفاعلات) لكن الوكلاء أعضاء كاملون في مساحة العمل، لا بوتات جانبية. كل رسالة وتفاعل وموافقة حدث موقّع وقابل للتدقيق على مُرحِّل تتحكم فيه. محايد للموديل: يشحن حاويات لـ Claude Code وCodex وGoose الخاص بـ Block، جميعها تتحدث Agent Client Protocol (ACP) — يعني أن أي وكيل متوافق مع ACP يستطيع الانضمام لنفس القناة.
حيث Buzz تعاوني، Berd هو ما تستخدمه فرق Block الخاصة للعمل مع الوكلاء بشكل خاص قبل أن يصبح العمل مشتركاً. تطبيق سطح مكتب محلي-أولاً (Tauri 2 + React 19، Apache 2.0، macOS/Windows/Linux) يمنح باني واحد بيئة واحدة عبر الموديلات والأدوات والمشاريع — يتحدث إلى Goose تحته عبر ACP، مع تاريخ محادثة مُخزَّن على الجهاز. قوس Block المُعلَن: "عمل الوكيل غالباً يبدأ خاصاً، لكن العمل المفيد نادراً ما يبقى منفرداً. ما نتعلمه في Berd سيساعدنا في تشكيل Buzz." وصل v0.6.2 بـ 91 مساهماً خلال أيام من فتح المصدر.
شحنت Nous Research دعماً رسمياً لربط Hermes Agent بـ Buzz عبر ثلاثة مسارات — وقت تشغيل Buzz Desktop بدون إعداد، جسر مُرحِّل لهوية مُستضافة، أو اتصال Hermes Gateway كامل يحافظ على المهارات الأصيلة، الذاكرة طويلة الأمد، الموافقات، وجدولة cron. نمط مُوثَّق متعدد الملفات يتيح لفريق واحد تشغيل عدة هويات Hermes متخصصة بالتوازي: قناة #research تشغّل ملف بحث ويب، قناة #content تشغّل ملف كتابة، قناة #infra تشغّل ملف DevOps — كل واحد بموديله الخاص، مهاراته، ذاكرته، وزوج مفاتيح Nostr، كلها داخل مساحة عمل Buzz واحدة بجانب Claude Code وCodex في نفس القناة.
فتحت MiniMax مصدر جوهر H3 — نظام التوليد كامل الوسائط الخاص بها يفهم سياق نص، صورة، فيديو، وصوت ويُخرج صوت-فيديو أصلي بقناتين حتى 2K، 15 ثانية. يحتل المرتبة #1 عالمياً على لوحة صدارة تحرير الفيديو من Artificial Analysis، مع أسعار خُفِّضت إلى حوالي ثلث الرواد المماثلين. ما هو مفتوح فعلياً: H3-Base (المولّد الأساسي بفئة 768p) على Hugging Face مع دعم يوم-0 لـ ComfyUI وDiffusers وWanGP — يعمل على 12GB VRAM بدقة 480p مع نقطة تفتيش int8 المُقلَّصة. طبقة المعالجة المسبقة (Context-IR) وتمريرة الرفع لـ 2K (Regenerate-2K) تبقيان API فقط حالياً.
بعد ثلاثة أشهر من Sonic-3.5، TTS القائم على نموذج الفضاء-الحالة من Cartesia يتصدر الآن كلا ساحتي الصوت من Artificial Analysis — 1,283 Elo على لوحة Provider Voice المفتوحة، والأهم، 1,123 على لوحة Controlled Voice، التي تستنسخ كل موديل منافس على نفس ثماني أصوات مرجعية لعزل محرك التركيب نفسه عن جودة كتالوج الصوت. زمن أول صوت أقل من 90 مللي ثانية، وسوم تعبير مضمّنة ([laughter])، استنساخ صوت فوري من 10 ثوانٍ، وتجاوزات نطق IPA. متاح تجريبياً الآن.
غطّت الجولة الماضية Cohere Transcribe Arabic (25.87 WER، Apache 2.0، تغطية لهجات خليجية/مصرية/شامية). يستحق الذكر بجانبه: موديل Speechmatics ثنائي اللغة عربي-إنجليزي، حي منذ وقت سابق من هذا العام، يُبلغ عن 4.5% WER على التفريغ العربي فقط ومعدل خطأ أقل بـ 35% من Google تحديداً على تبديل الأكواد عربي-إنجليزي — نفس النمط ثنائي اللغة الشائع في السياقات التجارية والسريرية الخليجية — بالإضافة إلى نسخة طبية ثنائية اللغة مخصصة لنشر الرعاية الصحية المنظَّمة. انتقلت Speechmatics إلى فوترة موحدة قائمة على الرصيد عبر خط منتجها بالكامل في 1 أغسطس، بدون تغيير سعر.
أول تطبيق سطح مكتب من Unsloth يتجاوز "حمّل ودردش" بكثير — يشغّل ويدرّب موديلات محلية (سير عمل LoRA، تسريع تدريب 2×، أقل 70% VRAM في اختبار المُصنّع)، يولّد صوراً وفيديو محلياً بما فيه دعم يوم-0 لـ MiniMax-H3 (B200 خفّض توليد 960×544، 124 إطاراً من 70+ ثانية إلى ~13)، ويربط Claude Code أو Codex مباشرة بموديل محلي عبر unsloth start --as-subagent. استدعاء الأدوات مُبلَّغ بدقة أعلى 50% مع استدعاءات مشوّهة تُصلَح وتُعاد المحاولة ذاتياً. يدعم Qwen3.8 وKimi K3 وMiniMax-H3 وGemma 4 وDeepSeek-V4 وGLM وFLUX جاهزة.
مُمكَّن بخفض OpenAI تكلفة Luna بنسبة 80% في 30 يوليو، Replit تشغّل الآن المحادثة، التخيّل، ومهام الوكيل البسيطة على GPT-5.6 Luna بدون تكلفة رصيد لمشتركي Core وPro — وكيل Replit الخاص يُصعِّد تلقائياً إلى Sol عندما تحتاج مهمة فعلياً منطقاً متقدماً، ثم يعود إلى Free Mode بمجرد الانتهاء. مشتركو Core يحصلون بحسب التقارير على حوالي 30× مخرج قابل للاستخدام أكثر من قبل. جزء من شراكة Replit-OpenAI المتعمقة مع المزيد من الإطلاقات المشتركة المُشار إليها.
قائمة مُتداولة على نطاق واسع في هذه الجولة تستحق الاحتفاظ بها لهذا السبب بالضبط — بينما تتضاعف نشرات الوكلاء عبر Hermes وClaude Managed Agents وBuzz وGrok Bot، تتبّع ما فعلوه فعلياً يتوقف عن كونه اختيارياً.