حان الوقت لحساب رموزك كما يفعل صاحب متجر بقالة تقليدي.كاتب المقال، المصدر: 0x9999in1، ME News
ملخص
- نهاية الانفجار في قوة الحوسبة هي فواتير مجنونة. انتهت رسميًا فترة العسل التي كانت تدعمها الشركات الكبرى، وأصبحت الرموز عملة صلبة في العصر الرقمي، وكل قطرة من قوة الحوسبة مُحدَّدة بسعر باهظ.
- الإهدار منتشر في كل مكان وملفت للنظر. إن التلميحات الزائدة، وتفريغ النفايات غير المنضبط الناتج عن RAG، والوكيلات العالقة في حلقات مفرغة، تُفرغ بسرعة وهدوء سيولة الشركات.
- الإنقاذ الذاتي المُهندَس بدقة أصبح ضرورة ملحة. لم تعد الذاكرة الدلالية (Semantic Cache) وضغط المُحفزات (Prompt Compression) وتوجيه النموذج (Model Routing) ميزات تكميلية اختيارية، بل هي الثلاثة أدوات حاسمة للبقاء.
- إطار Agent المتقدم يحدد الاتجاه. تمثل الوكلاء مثل OpenClaw وHermes "اقتصاد الرموز" الحقيقي من خلال إدارة السياق الدقيقة والإخراج المُهيكل في سيناريوهات محدودة الموارد مثل الأجهزة المحمولة.
- العلاج النهائي هو إدراك منطق العائد على الاستثمار (ROI). اترك الاستخدام العشوائي وانتقل إلى التشغيل الدقيق. ارتفاع أسعار الحوسبة ليس نهاية الصناعة، بل هو إعادة ترتيب قاسية تترك فقط اللاعبين الذين يفهمون حقًا احترام التكاليف.
زوال الوهم: عندما تتحول فواتير القوة الحسابية إلى علامة موت
الرياح توقفت.
على مدار السنتين الماضيتين، عشنا في وهم مُنسَّق بعناية من قبل رأس المال والشركات العملاقة. في هذا الوهم، بدا أن قوة الحوسبة هي ماء الصنبور. فبمجرد فتح الصنبور، كانت النماذج الكبيرة تُفرز باستمرار عبارات فخمة وأكواد معقدة وإجابات تبدو تعرف كل شيء.
نحن نُسرف. نقوم بحقن وثائق طويلة تضم عشرات الآلاف من الكلمات دون أي تردد في الـPrompt. نجعل نماذج رائدة ببلايين المعلمات تنفذ مهام تافهة مثل "جعل الحروف الأولى من هذه الجملة كبيرة".
لماذا؟ لأنها رخيصة. لأن OpenAI وAnthropic وغيرها يستخدمون أموال المستثمرين لدفع ثمننا.
لكن الآن، استيقظ الحلم.
القدرة الحسابية تشهد زيادة شاملة في الأسعار.这不是危言耸听,这是正在发生的冷酷现实。英伟达H100芯片的争夺战已经从商业竞争演变成了地缘政治级别的博弈。数据中心的能耗正在逼近电网的极限。每一次API的调用背后,都是硅晶片的燃烧和冷却塔的嘶吼。
الكبار لم يعودوا يمارسون الخير. على الرغم من أن وحدة تسعير API لا تزال هي "1K Tokens" الصغيرة، إلا أن عندما تبدأ أعمالك في التوسع، وعندما يتجاوز عدد الطلبات اليومية ملايين أو عشرات الملايين، فإن هذا الرقم لم يعد تافهاً.
ذلك هو الشلال. ذلك هو آلة سحب الدم. ذلك هو الكابوس الذي يُوقظ أي مسؤول مالي في شركة ناشئة في منتصف الليل.
الرمز، الوحدة الأساسية الأصلية في عصر النماذج الكبيرة، أصبح رسميًا مساويًا للدولار واليوان. لم يعد "الكلمة الواحدة تساوي ألف ذهب" تعبيرًا مبالغًا فيه، بل هو تقرير مالي حقيقي.
بعد ارتفاع قوة الحوسبة، كيف توفر التوكنات؟
هذا ليس مجرد مشكلة تقنية صعبة. إنه مسألة حياة أو موت لقدرة النموذج التجاري على العمل.
الزاوية الخفية: كيف فقدت رموزك بالضبط؟
To stop the bleeding, first find the wound.
الكثير من الناس لا يفهمون استهلاك الرموز. إنهم ينظرون إلى الفواتير التي ترتفع بشدة كل شهر، كأنهم ينظرون إلى نص غير مفهوم. في الواقع، غالبًا ما يحدث فقدان الرموز في الزوايا الخفية الأقل وضوحًا.
ثمن الأدب وفخ الكلام الفارغ
هل تتحدث مع الذكاء الاصطناعي بأسلوب مهذب؟
مرحبًا، هل يمكنك مساعدتي؟ شكرًا جزيلًا، أحتاج منك أن تتقمص دور خبير تسويق محترف...
توقف. توقف.
كإنسان، أنت رجل مهذب. لكن في اقتصاد الرموز، أنت مُسرف.
النموذج الكبير لا يملك مشاعر. إنه لا يحتاج إلى "من فضلك" و"شكرًا". إنه لا يحتاج إلى تلك المحادثات الاجتماعية الخالية من أي زيادة معلوماتية. كل كلمة، وكل علامة ترقيم، وحتى كل مسافة، هي Token. وكلها تخضع للدفع.
الأكثر رعبًا هو "الكلام العديم الفائدة" الذي يُولّده الإطار. كثير من المطورين، عند بناء التطبيقات، يستخدمون تعليمات نظامية (System Prompt) مفرطة الطول ومعقدة جدًا لضمان استقرار المخرجات. "يجب عليك اتباع المبادئ العشرة التالية..." "إذا كنت لا تعرف، فقل إنك لا تعرف، ولا تبتكر إجابات..."
هل هذه الكلمات مفيدة؟ نعم. لكن إذا كان يجب إعادة حساب آلاف الرموز هذه في كل محادثة، وفي كل جولة من التفاعل متعدد الخطوات، فإن هذا الهدر هائل. نافذة السياق ليست خزانة تخزين مجانية، بل هي منطقة وسط مدينة مانهاتن ذات قيمة عالية.
RAG غير الخاضع للرقابة: التدفق العنيف للوثائق
يُعتبر RAG (الاسترجاع المعزز بالولادة) الحل السحري لمشكلة الوهم في النماذج الكبيرة.
لكن RAG في الواقع غالبًا ما يكون كارثة.
RAG المثالي: استرجاع ثلاث جمل الأكثر صلة بدقة، وتقديمها للنموذج للحصول على إجابة مثالية.
RAG واقعي: يطرح المستخدم سؤالاً، وقاعدة البيانات المتجهية تلتقط عشوائيًا عشرة مستندات PDF طويلة تصل إلى عشرة آلاف كلمة وترميها مباشرة على وجه النموذج.
"ابحث عن الإجابة بنفسك." فكّر المطور.
هذا ليس مجرد كسل. هذا جريمة ضد قوة الحوسبة.
المعلومات الخلفية الزائدة لا تؤدي فقط إلى تشويش آلية الانتباه للنموذج (مما يتسبب في ظاهرة "الضياع في المنتصف")، بل تؤدي أيضًا إلى استهلاك هائل لوحدات التوكن. تظن أنك طرحت سؤالاً بسيطًا، لكنك في الواقع جعلت النموذج يقرأ نصف مكتبة. وهذه تكلفة القراءة، أنت من يدفعها.
الوكيل العالق في حلقة مفرغة
الأكثر تكلفة من RAG هو العامل غير الخاضع للرقابة.
إعطاء الذكاء الاصطناعي القدرة على التخطيط والتفكير واستخدام الأدوات هو الموضة المطلقة الحالية. إن نمط ReAct (الاستدلال والعمل) يجعل الذكاء الاصطناعي يبدو وكأنه يعمل مثل إنسان.
أحتاج إلى التحقق من طقس اليوم.
استدعاء واجهة برمجة تطبيقات الطقس.
الاستعلام فشل.
فكرت: فشلت للتو، سأحاول مرة أخرى.
استدعاء واجهة برمجة تطبيقات الطقس.
هل لاحظت؟ إذا تعطلت واجهة برمجة التطبيقات أو دخل منطق الوكيل في مأزق، فسيبدأ بالدوران بشكل جنوني داخل هذه الدورة. كل جولة من "التفكير" و"الإجراء" تستهلك رموز إخراج باهظة الثمن.
أما سعر Token الصادر، فهو عادةً عدة أضعاف سعر Token المدخل.
Agent الذي لا يحتوي على آلية إيقاف الطوارئ وقيود على الحد الأقصى لعدد التكرارات هو حفرة سوداء تبتلع الرموز. يمكنه أن يفرغ بطاقتك الائتمانية أثناء نومك.
الحفر في العظم لعلاج السم: دليل إنقاذ هندسي صارم
الشكوى من الزيادة في الأسعار عديمة الفائدة. المراقبون الناضجون يركزون فقط على الحلول.
عندما أصبح تجميع القوة الحسابية بشكل عنيف شيئًا من الماضي، أصبحت القدرة الهندسية الدقيقة هي الحاجز الوحيد. كيف توفر؟ مثل عصر آخر قطرة ماء من منشفة، استخرج كل قيمة من كل رمز.
الذاكرة التحليلية (Semantic Cache): لا تدفع مرتين لنفس السؤال
هذه أبسط وأكثر طريقة توفيرًا للنقود.
طبيعة الإنسان هي أن يكون نسّاخًا، حيث تكون أسئلة المستخدمين غالبًا متشابهة جدًا. مثل أسئلة "كيف أعيد تعيين كلمة المرور؟" و"كيف أحصل على فاتورة؟" التي قد تُطرح مئات أو آلاف المرات يوميًا.
إذا قمت بالاستعانة بـ GPT-4 في كل مرة، فأنت تستخدم مدفعًا لقتل بعوضة.
قم بتطبيق التخزين المؤقت الدلالي. عندما يطرح المستخدم سؤالاً، قم أولاً بتحويله إلى متجه، ثم قم بإجراء مطابقة التشابه في قاعدة بيانات التخزين المؤقت. إذا كان هناك شخص قد سأل سؤالاً مشابهًا من قبل (مثل "ماذا أفعل إذا نسيت كلمة المرور؟") وتم تحقيق درجة تشابه عالية، فقم بإرجاع الإجابة من التخزين المؤقت مباشرة.
بدون استخدام نموذج كبير. لا يستهلك أي رمز. انخفاض التأخير من الثواني إلى الملي ثانية.
هذا ليس مجرد توفير للمال، بل هو هجوم مُخفض لتجربة المستخدم.
ضغط المُحفّزات (Prompt Compression): "الحد الأدنى" على مستوى الخوارزمية
Since lengthy context is the original sin, compress them.
هذا ليس مقصودًا أن تقوم بحذف الجمل يدويًا، بل يعتمد على الخوارزميات. حاليًا، ظهرت في الصناعة عدة تقنيات لضغط التعليمات البرمجية بناءً على إنتروبيا المعلومات. هذه الأدوات قادرة على تحليل النص الطويل لتحديد أي الكلمات أساسية لفهم النموذج الكبير للدلالة، وأيها كلمات توقف أو معلومات زائدة يمكن التخلي عنها.
يمكنها ضغط نص مكون من 1000 رمز إلى 300 رمز مع الحفاظ على المعنى الأساسي دون فقدان (أو بفقدان طفيف).
دع الآلات تتحدث مع الآلات. استخدم لغة "مارسية" تبدو للإنسان متقطعة أو حتى خالية من القواعد للتحدث مع النماذج الكبيرة. لأن آلية الانتباه الذاتي للنماذج الكبيرة قوية بما يكفي لتفهمها.
لقد وفرت 70% من رسوم المرور.
توجيه النموذج (Model Routing): جعل الشخص المناسب يقوم بالمهام المناسبة
هذه هي المرحلة التي تختبر مهارات المهندسين المعماريين أكثر من أي وقت مضى.
لا تُلقِ جميع المهام على النموذج الأغلى والأقوى دون تفكير. لا تستخدم مدفعًا لقتل دجاجة.
داخل تطبيق ذكاء اصطناعي ممتاز، يجب أن يكون مصفوفة من نماذج متعددة تعمل معًا. نحن بحاجة إلى "مُوجّه (Router)" لتقسيم المهام.
- استخراج كيانات بسيط، تحويل تنسيق، ترجمة متعددة اللغات؟ قم بإرسالها مباشرة إلى نماذج صغيرة مفتوحة المصدر مُستضافة محليًا (مثل Llama 3 8B) أو واجهات برمجة تطبيقات شديدة التكلفة المنخفضة (مثل Claude 3 Haiku). التكلفة شبه معدومة.
- هل تحتاج إلى استدلال منطقي متعمق، أو كتابة كود معقد، أو تخطيط متعدد الخطوات؟ في هذه الحالة، استخدم أدوات مثل GPT-4o أو Claude 3.5 Sonnet.
كشركة تعمل بكفاءة عالية. لا تُحيل الاستفسارات التي يمكن للاستقبال التعامل معها إلى المدير التنفيذي. بعد ارتفاع أسعار القوة الحسابية بشكل شامل، من يستطيع تنفيذ آلية التوجيه هذه بسلاسة ودقة أكبر، سيتمكن من خفض تكلفة رمزه المجمع إلى عُشر تكلفة المنافسين.
الاستكشاف المتقدم: من OpenClaw و Hermes إلى "اقتصاديات الرموز" للوكلاء
الحدود التقنية الحقيقية، شمّت منذ زمن رائحة دم ارتفاع قوة الحوسبة.
عندما نوجه انتباهنا إلى أكثر أنظمة الوكلاء تقدمًا حاليًا — خاصة تلك التي تحاول كسر قيود قوة الحوسبة السحابية والتوسع نحو الحافة والأجهزة المحمولة — ستجد أن حملة مكثفة لتحسين الرموز قد بدأت بالفعل.
الضغط من الجوال: لا يوجد سياق فاخر
لماذا أذكر تكامل الجوال بشكل خاص؟ لأنه المختبر النهائي لاختبار كفاءة الرمز.
على جهاز كمبيوتر أو في السحابة، قد تتمكن من تحمل تأخيرات بضع ثوانٍ ونوافذ سياق كبيرة. لكن على الهاتف، عند تشغيل العامل في بيئات أجهزة محدودة الموارد، فإن النطاق الترددي هو عقبة، والذاكرة هي عقبة، والبطارية هي أيضًا عقبة.
هذا يجبر الإطار على أن يكون شديد البخل.
عند مراقبة مسار تطور OpenClaw، ستجد أنه يتحكم في استخدام الرموز بشكل شبه مرضي. أثناء تنفيذ المهام المعقدة، لا تعتمد OpenClaw على طبقات السياق الكامل العدوانية. على العكس، فهي تعتمد بشدة على تحسين المخرجات المهيكلة.
إنها تعلم أن السماح للنموذج بالعمل بحرية يؤدي إلى تدفق غير قابل للتحكم من الرموز. من خلال إجبار النموذج على إخراج النتائج وفقًا لنموذج JSON صارم أو حتى تنسيق أكثر أساسية صديق للثنائي، يزيل OpenClaw بشكل كبير الحروف الزائدة من عملية التوليد. إنها لا تجعل الذكاء الاصطناعي "يتحدث"، بل تجعله "يقدم الجداول" مباشرة.
هذا القيود الصارمة على تنسيق الإخراج، على الرغم من أن مظهرها يوحي بأنها مصممة لتسهيل تحليل البرامج السفلية، إلا أنها في ظل ندرة قوة الحوسبة الحالية، تحقق بشكل موضوعي عملية "توفير بيانات" رائعة.
وكيل هيرميس: إدارة سياقية جراحية
راجع أيضًا سلسلة نماذج Hermes التي أطلقتها Nous Research وتطبيقاتها المبنية على الوكلاء.
عندما تقوم العديد من النماذج مفتوحة المصدر بإجراء مكالمات الوظائف، فإنها غالبًا ما تحتاج إلى تجربة وأخطاء متكررة بسبب ضعف قدرتها على الفهم، مما يستهلك كمية كبيرة من الرموز. أما الدقة المتميزة لـ Hermes فهي تكمن في دقتها العالية في اتباع التعليمات.
الدقة تعني فعل الشيء بشكل صحيح في المرة الأولى. فعل الشيء بشكل صحيح في المرة الأولى هو أكبر توفير.
في التفاعلات المتعددة، مع تعمق المحادثة، يزداد حجم نافذة السياق مثل كرة ثلج. لقد تخلص اللاعبون المتقدمون في نظام Hermes Agent من ممارسة "الاحتفاظ بجميع السجلات التاريخية" التي تعتبر سخيفة.
They introduced a dynamic memory mechanism.
- الذاكرة العاملة (Working Memory): احتفظ فقط بآخر 3-5 جلسات حوار مباشرة، واحتفظ بالرشاقة.
- الذاكرة طويلة المدى (Long-term Memory): عند تجاوز حد النافذة، يتم تفعيل نموذج خلفي خفيف جدًا لتلخيص المحادثة السابقة إلى نقاط أساسية موجزة، وتخزينها في قاعدة المتجهات.
تم التخلص من المحادثة القديمة، لكن المعرفة ظلت محفوظة.
إنهم لا يتخلصون من النفايات، بل يقومون بجراحة دقيقة لإزالة الذاكرة وتخيطها. هذا الإدارة الدقيقة للسياق لا تكسر فقط الحدود المادية لطول الرموز، بل تحقق أيضًا انخفاضًا حادًا في تكلفة قوة الحوسبة على المستوى الكلي.
سواء كان ذلك التحكم المنظم لـ OpenClaw أو إدارة الذاكرة الديناميكية لـ Hermes، فإنها جميعًا تكشف عن اتجاه: مستقبل الوكلاء لن يُقاس بمن يستطيع استخدام أدوات أكثر، بل بمن يستطيع إنجاز المهام الأكثر تعقيدًا ضمن ميزانية توكين شديدة التقييد.
هذا رقصٌ مُقيّد بالسلاسل. ومن يرقص بأفضل شكل، سيكسب العصر القادم.
قفزة فكرية: من التفكير الاستهلاكي إلى التفكير الاستثماري (إدراك العائد على الاستثمار)
افصل جميع المصطلحات التقنية، ودعنا نعود إلى جوهر العمل.
ارتفاع أسعار القوة الحسابية على نطاق واسع، لم يجلب التغيير الأكبر من خلال إجبار المهندسين على العمل ليلاً لتعديل الكود. بل أتى بتحديث إجباري لنمط التفكير في صناعة الذكاء الاصطناعي بأكملها.
في عصر التكلفة المنخفضة، نتعامل مع الرموز بعقلية استهلاكية.
مثلما تزور سوبر ماركت وتحط السلع المخفضة في عربة التسوق. نحن لا نهتم ما إذا كان هذا الميزة تحتاج حقًا إلى نموذج كبير، نحن فقط نهتم "بأنها تبدو رائعة".
تقوم العديد من الشركات بربط نماذج اللغة الكبيرة بشكل عشوائي أنظمتها الداخلية، وتمنح كل موظف حسابًا، حتى أن بعضها يطلب من الذكاء الاصطناعي إنشاء قائمة الطعام في المقصف. وعندما ظهرت فاتورة نهاية الشهر، صُدموا.
الآن، يجب أن ننتقل إلى "التفكير الاستثماراتي".
كل استهلاك للرمز المميز هو استثمار. يجب حساب عائد الاستثمار (ROI) عند وجود استثمار.
ما الذي جلبته لي هذه العملة المعدنية؟
هل تم تحسين معدل إغلاق التذاكر الخاصة بخدمة العملاء؟
هل تم تقليل وقت إصلاح الأخطاء للمبرمجين؟
أم فقط حصلت على تعليق عديم المعنى من المستخدم: "هاها، هذا الذكاء الاصطناعي مضحك حقًا"؟
إذا كانت وظيفة ما تتطلب تكلفة قدرها 10 سنتات باستخدام محرك قواعد أو تعلم آلي تقليدي، بينما يتطلب دمج نموذج كبير تكلفة توكين قدرها دولار واحد، لكن الزيادة في معدل التحويل لا تتجاوز 2% ضئيلة.
إذًا، قطّعه. قطّعه دون أية تردد.
لم يعد يتم السعي وراء ميزات الذكاء الاصطناعي "الكبيرة والشاملة"، بل تم التحول إلى الهجمات الدقيقة "الصغيرة والجميلة". يجب أن تستند إعادة هيكلة عمليات الأعمال إلى حساسية شديدة تجاه تكلفة قوة الحوسبة.
يجب أن نتعلم أن نقول "لا" لإدارات الأعمال. عندما يطلبون منك "هل يمكن للذكاء الاصطناعي قراءة جميع تقارير البحث الـ100,000 هذه وإعطائك ملخصًا؟"، اسألهم بالمقابل: "هل عائدات عملك تغطي تكلفة API这几千万Token؟"
احسب. كن دقيقًا في التخطيط. احسب عملاتك التوكنية كما يفعل صاحب متجر بقالة تقليدي.
هذا لا يبدو كأنه سايبربانك على الإطلاق. هذا تقليدي.
لكن هذا بالضبط هو الطريق الضروري الذي يجب أن يسلكه الذكاء الاصطناعي ليصل إلى النضج.
الخاتمة: المنظر بعد انسحاب المد
الاحتفالات حول النقاط الساخنة تكون دائمًا مؤقتة، وستعمل قوانين الجاذبية التجارية في النهاية.
الزيادة الشاملة في القوة الحسابية، ليست أزمة أكثر مما هي غسلة متأخرة. إنها تثقب بعنف الفقاعة التي نفخها الدعم غير المحدود، وتعيد الجميع إلى الواقع البارد.
لكن هذا ليس شيئًا سيئًا.
إنه يجبرنا على التخلي عن الإيمان الأعمى بـ"القوة الكبيرة تنتج المعجزات"، ويعيد إحياء احترامنا لفعالية الهندسة. إنه يُزيل اللاعبين الذين لا يعرفون سوى كتابة بضعة أوامر توجيهية ويتجولون لخداع الآخرين، ويبقي المسرح مفتوحًا للفرق المتخصصة التي تفهم البنية التحتية الأساسية، وتعرف كيفية توجيه النماذج، وتستطيع استغلال قوة المعالجة على الأجهزة المحمولة إلى أقصى حد.
عندما تستقر الأمور، فإن الشركات التي ستظل قادرة على البقاء والازدهار لن تكون تلك التي تمتلك النموذج الأغلى.
بل أولئك الذين ينظرون إلى أرقام الرموز التي تتطاير بسرعة على لوحة القياس، ولا يزالون هادئين وواثقين أنهم يكسبون أكثر مما ينفقون.
في النهاية، عندما ينحسر المد، نعرف من يسبح عاريًا. وهذه المرة، إنما ينحسر مدّ مكاسب القوة الحسابية.
فقط من يُصاغ كل رمز token كأنه ذهب، يستطيع ارتداء الدروع الحقيقية.
المصدر:
- Nvidia Corporation. (2025). Data Center Compute Constraints and Global Supply Chain Outlook. Investor Relations Report.
- Anthropic. (2025). تخزين مُحفّزات واقتصاد نافذة السياق في وكلاء Claude المدارة. وثائق واجهة برمجة تطبيقات Anthropic.
- OpenAI. (2025). أفضل الممارسات لتحسين الرموز وتنفيذات RAG. منصة مطوري OpenAI.
- Nous Research. (2025). Hermes Agent Framework: Efficient Context Management for Edge Computing. Nous Research Technical Blog.
- مجتمع OpenClaw. (2026). التكامل المتنقل واستراتيجيات الرموز الخالية من النفايات في سير العمل العميقة الوكيلة. مستودع GitHub / ورقة تقنية.
- Bloomberg. (2026). The End of the AI Subsidy Era: How Datacenter Energy Caps are Restructuring Cloud Pricing. Bloomberg Technology.
