تعمّق

من الجبر إلى الوكلاء: تاريخ النماذج اللغوية الكبيرة على امتداد ١٢٠٠ عام

ألف ومئتا سنة، من كتاب في الجبر أُلِّف للمواريث والتجارة، إلى مجال يُشبع فيه نموذجٌ اختباراً غير رسمي في الرياضيات بينما لا يتجاوز نموذجٌ آخر ٧٧٫٣٪ في أسئلة الوقائع البسيطة. التاريخ كاملاً، وقد نُزعت منه الأساطير.

آخر تحديث · نحو ١٦٬٦٠٠ كلمة — أي ما بين سبعين وخمس وثمانين دقيقة بسرعة قراءة معتادة. والأفضل أن تستعين بالمحتويات وتقرأه على أقسام.

كيف ولّد شانون نصاً بكتاب وإصبع

سنة ١٩٤٨، في مختبرات بِل، ولّد رجلٌ نصّاً بيده. وكل ما جرى بعد ذلك هو قصة إزالة القيد الذي أوقفه.

أراد كلود شانون أن يبيّن أن الإنجليزية يمكن تقريبها بالإحصاء. ففتح كتاباً عشوائياً، ووضع إصبعه على حرف، فدوّنه، ثم فتح الكتاب على صفحة أخرى وقرأ حتى صادف ذلك الحرف، فدوّن الحرف الذي يليه. ثم كرّر. ثم كرّر، حتى صار لديه فقرة كاملة.

هذا هو «التوليد بالانحدار الذاتي»: يتنبّأ النظام بالوحدة التالية اعتماداً على ما سبق، ثم يضيفها إلى السياق ويكرّر العملية. وهو بالضبط ما تفعله الآلة في هاتفك حين تُكمل جملتك. فعله شانون بكتاب وإصبع، وتوقّف حيث توقّف لأن الجهد اليدوي — بعبارته هو — يصير هائلاً في المرحلة التالية.

لبناء المثال (٣) مثلاً، يفتح المرء كتاباً عشوائياً ويختار حرفاً عشوائياً في الصفحة، فيسجّله. ثم يفتح الكتاب على صفحة أخرى ويقرأ حتى يصادف هذا الحرف، فيسجّل الحرف الذي يليه … وسيكون من المثير بناء تقريبات أبعد، غير أن الجهد المبذول يصير هائلاً في المرحلة التالية.
اعرض النصّ الأصلي

To construct (3) for example, one opens a book at random and selects a letter at random on the page. This letter is recorded. The book is then opened to another page and one reads until this letter is encountered. The succeeding letter is then recorded … It would be interesting if further approximations could be constructed, but the labor involved becomes enormous at the next stage.

Shannon, 1948, §3

في الأسفل العيّنات الستّ التي أنتجها، منقولة حرفاً بحرف من الورقة الأصلية. تنقّل بينها وشاهد الإنجليزية تتركّب من لا شيء سوى العدّ. لم يُعلَّم هذا الإجراء قواعد النحو. ولم يُعطَ معجماً. كل خطوة تنظر فقط إلى قدر أكبر قليلاً مما سبق.

مقدار السياق الذي بُنيت منه العيّنة

وفي الأخيرة عشر كلمات متتالية كان يمكن لإنسان أن يكتبها. لاحظ شانون ذلك، وكتب الجملة التي ستقضي خمسة وسبعون سنة في إثباتها:

إن تتابع الكلمات العشر المعيّن «هجوم على كاتب إنجليزي بأن طابع هذا» ليس غير معقول البتة. ويبدو إذن أن عمليةً عشوائية معقّدة بما يكفي ستقدّم تمثيلاً مُرضياً لمصدر متقطّع.
اعرض النصّ الأصلي

The particular sequence of ten words “attack on an English writer that the character of this” is not at all unreasonable. It appears then that a sufficiently complex stochastic process will give a satisfactory representation of a discrete source.

Shannon, A Mathematical Theory of Communication, 1948, §3

كلما رأيت قدراً أكبر من الجملة، قلّ ما يضيفه الحرف التالي. وقد قاس شانون مقدار ذلك النقص.

الأرقام التي بُني عليها هذا المخطّط
عدد حروف السياق المتاحةالحد الأعلىالحد الأدنى
1 4.033.19
2 3.422.5
3 32.1
4 2.61.7
15 2.11.2
100 1.30.6
Shannon, Prediction and Entropy of Printed English, 1951, Table I

وإحصاءاته، بالمناسبة، جاءت من جداول ترددات في كتاب شعبي عن كسر الشفرات صدر سنة ١٩٣٩، ومن دراسة أصوات لغوية سنة ١٩٢٣ — مصادر مذكورة، لا «بيانات تدريب» بالمعنى الحديث. وذلك القيد، أن الجهد يصير هائلاً في المرحلة التالية، هو الشيء الوحيد الفاصل بين فقرته وفقرتك. وقد لزم لإزالته: الكهرباء، وثلاث حروب، وشتاءان أكاديميان، ومشكلة ترجمة في غوغل، ونحو أربعمئة مليار دولار.

وهذه قصة إزالته.

كيف بدأت فكرة الحوسبة قبل الكهرباء

قبل أن يقدر أحد على بناء آلة تفكّر بزمن طويل، توصّل عدد من الناس إلى ما ينبغي أن تكون عليه.

فكرة أن الاستدلال قابل للمَكْنَنة ليست فكرة عصر الحاسوب. إنها تظهر كلما لاحظ أحدهم أن إجراءً ما يمكن تدوينه بتمامٍ يجعل اتّباعه لا يحتاج إلى حُكم أو تقدير — وعندها يكفّ السؤال عمّن يتّبعه أو ما يتّبعه عن أن يكون مهمّاً.

تروس برونزية متشابكة عن قرب، معدن دافئ على أرضية داكنة.
تروس برونزية من النوع الذي وُجد في آلة أنتيكيثيرا: عجلة بـ٢٢٣ سنّاً تعدّ أشهر دورة خسوف، قُطعت باليد، قبل الكهرباء بألفي سنة.

ستّ لحظات، أسهمت كلٌّ منها بقطعة لا يزال النموذج اللغوي يستعملها اليوم.

أضاف كلٌّ من هؤلاء قدرةً احتاجها من بعده. اقرأها سلسلة فتوحات لا قائمة أذكياء.

الأرقام التي بُني عليها هذا المخطّط
1. أنتيكيثيرا، نحو ١٠٠ ق.منموذج مادي يحسب نتيجة
2. الخوارزمي، نحو ٨٢٠إجراء مكتوب يستطيع أي أحد اتّباعه
3. لول، ١٢٧٤آلة خرجها حجّة لا عدد
4. باسكال، ١٦٤٢حساب يجري دون أن يقوم به إنسان
5. لايبنتس، ١٧٠٣كل شيء قابل للتعبير برمزين
6. جاكار، ١٨٠١تعليمات تعيش خارج الآلة
Dates as given in the sources listed at the foot of this page

آلة أنتيكيثيرا

نحو ٢٠٥–٨٧ ق.م

صندوق برونزي بحجم كتاب سميك، ٣٤ × ١٨ × ٩ سم، يضمّ ثلاثين ترساً على الأقل. أكبر ترس باقٍ له ٢٢٣ سنّاً، و٢٢٣ ليس رقماً اعتباطياً: إنه عدد أشهر دورة «ساروس» للخسوف. انتُشلت من قرب جزيرة يونانية سنة ١٩٠١، وبقيت في متحف أثينا سنةً كاملة قبل أن يلاحظ فاليريوس ستايس، في ١٧ مايو ١٩٠٢، أن إحدى كتل الصخر يبرز منها ترس.

ما يجدر تذكّره يصف نقشها الكواكب بأنها «كُرَيّات»، والشمس بأنها «كُرَيّة ذهبية». الذين صنعوها دوّنوا ما يصنعون بصيغة التصغير، كما يفعل الصائغ.

محمد بن موسى الخوارزمي

نحو ٧٨٠ – نحو ٨٥٠

كتابه «الكتاب المختصر في حساب الجبر والمقابلة»، المؤلَّف في بغداد نحو سنة ٨٢٠، أعطى الجبر اسمه، وأعطتنا الصيغة اللاتينية لاسمه — Algoritmi — كلمة «خوارزمية». لم يخترع الخوارزمية؛ فالإجراءات المتسلسلة أقدم من ذلك بكثير. ما حدث هو مصادفة لغوية من أجمل ما يكون.

ما يجدر تذكّره الكتاب المؤسِّس للجبر لا يحوي رمزاً جبرياً واحداً. كل معادلة فيه نثر، وأمثلته المحلولة مسعّرة بالدراهم، لأنه كُتب لفضّ المواريث والقسمة والقضايا والتجارة.

رامون لول

١٢٣٢–١٣١٦

رجل من مايوركا بنى، بعد رؤيا دينية سنة ١٢٧٤، «الفنّ» (Ars): أربعة أشكال، آخرها ثلاثة أقراص ورقية دوّارة تولّد آلياً كل تركيبة من تسعة مبادئ. تُدير العجلات، فتخرج الحجج. إنها أول آلة يكون خرجها استدلالاً لا عدداً.

ما يجدر تذكّره بناها ليُقنع المسلمين واليهود بالبرهان العقلي لا بالقوة، وتعلّم العربية لهذا الغرض. حلم «مَكْنَنة الاستدلال» بدأ إذن تقنيةً للتبشير موجّهة إلى العالم الإسلامي.

بليز باسكال

١٦٢٣–١٦٦٢

في الثامنة عشرة أو التاسعة عشرة بدأ ببناء آلة حاسبة لأبيه، وكان مفوّضاً للضرائب في روان يغرق في الحساب اليدوي. خمسون نموذجاً أوليّاً تقريباً، ونحو عشرين آلة بيعت في عقد، وتسع باقية. النقل فيها يحرّكه ثِقلٌ ساقط لا سلسلة تروس.

ما يجدر تذكّره أول آلة حاسبة تُباع فعلاً، وكانت فشلاً تجارياً. احتكار ملكي من لويس الرابع عشر، وعشرون وحدة في عشر سنين.

غوتفريد فيلهلم لايبنتس

١٦٤٦–١٧١٦

حلم بلغة رمزية كونية وحسابٍ للاستدلال يعمل عليها، بحيث إذا اختلف فيلسوفان جلسا وقالا: calculemus — «لنحسب». وكان قد توصّل إلى حساب الثنائي قبل سنوات من وصول مخطّط سداسيات «كتاب التغيّرات» إليه من يسوعي في بكين؛ فالمخطّط دفعه إلى تنقيح بحثه لا إلى ابتكاره. أعاد النسخة المنقّحة بعد ستة أيام من وصولها، وصدر النشر بعد نحو شهر.

ما يجدر تذكّره آلته المدرّجة لم تعمل قط بموثوقية — عيب تصميمي في آليّة النقل. ولمّا مات في هانوفر لم يحضر جنازته أحد سوى سكرتيره الشخصي.

جوزيف ماري جاكار

عُرِض ١٨٠١، وسُجّل ١٨٠٤

نول تتحكّم فيه سلسلة من البطاقات المثقوبة، يقرّر كل ثقب أي خيوط السَّدَاة ترتفع في تمريرة واحدة للمكوك. النمط يعيش خارج الآلة، على البطاقات. غيّر البطاقات يتغيّر القماش دون إعادة بناء النول. هذه هي فكرة «البرنامج» كاملةً، سنة ١٨٠١، وبالحرير.

ما يجدر تذكّره نحو سنة ١٨٣٩ أنتج النسّاج ميشيل-ماري كاركيّا بورتريهاً حريرياً منسوجاً لجاكار نفسه. تطلّب ٢٤٫٠٠٠ بطاقة مثقوبة. يبدو كأنه نقش محفور. لكنه قماش — ويمكن القول إنه أول صورة تُصيَّر من برنامج مخزَّن.

اثنتان منها تستحقّان وقفة أطول، لأن كلتيهما تُروى على نحو خاطئ باستمرار.

الجبر نُظِّم لمسائل عملية، والمواريث إحداها

مقدّمة كتاب الخوارزمي تقول بالضبط ما الغرض منه، وليس هو التجريد:

شجّعني على تأليف كتاب مختصر في الحساب بالجبر والمقابلة، أقصره على ما هو أيسر وأنفع في الحساب، مما يحتاج إليه الناس دائماً في المواريث والوصايا والقسمة والقضايا والتجارة، وفي كل ما يتعاملون به بينهم، أو حيث يكون مسح الأراضي وحفر الأنهار والحساب الهندسي وغير ذلك من الأصناف والأنواع.
اعرض النصّ الأصلي

has encouraged me to compose a short work on Calculating by (the rules of) Completion and Reduction, confining it to what is easiest and most useful in arithmetic, such as men constantly require in cases of inheritance, legacies, partition, law-suits, and trade, and in all their dealings with one another, or where the measuring of lands, the digging of canals, geometrical computation, and other objects of various sorts and kinds are concerned.

al-Khwārizmī, trans. Frederic Rosen, The Algebra of Mohammed ben Musa (London, 1831), pp. 3–4

أعد قراءة تلك القائمة: المواريث، والوصايا، والقسمة، والقضايا، والتجارة — ثم، في الجملة نفسها، مسح الأراضي وحفر الأنهار والحساب الهندسي. والتقنيات الجبرية أقدم من الخوارزمي؛ وما فعله هو أنه نظّمها وكتب الكتاب الذي جعلها قابلة للتعليم. وعلم الفرائض يقتضي فعلاً حلّ معادلات خطية — إنه حساب تترتب عليه أحكام شرعية — والمواريث تتصدّر قائمته هو، لكنها بند في قائمة مسائل عملية لا الغرض الوحيد من العلم كله.

وأشهر أمثلته المحلولة معادلة تربيعية، تُحلّ بإكمال المربّع، بالكلام، بلا رموز، ومسعّرة بالدراهم:

مالٌ وعشرة أجذاره تعدل تسعة وثلاثين درهماً؛ أي: ما المال الذي إذا زيد عليه عشرة أجذاره بلغ تسعة وثلاثين؟
اعرض النصّ الأصلي

one square, and ten roots of the same, amount to thirty-nine dirhems; that is to say, what must be the square which, when increased by ten of its own roots, amounts to thirty-nine?

Rosen 1831, p. 8

والجواب نثراً: نصِّف العشرة فتصير خمسة؛ اضربها في نفسها فتصير خمسة وعشرين؛ زِد عليها تسعة وثلاثين فتصير أربعة وستين؛ خذ جذرها فهو ثمانية؛ اطرح منه الخمسة؛ فالجواب ثلاثة. ولا يوجد في الكتاب الذي أعطى الجبر اسمه رمز جبري واحد.

بطاقات مثقوبة موصولة في سلسلة، والثقوب تلتقط الضوء.
سلسلة بطاقات مثقوبة تغذّي نول جاكار. النمط ليس في الآلة. إنه في البطاقات، وتغييرها يغيّر القماش.

حين ظهر البرنامج على نولٍ من حرير

نول جاكار هو المكان الذي تغادر فيه التعليمات جسد الآلة لأول مرة. وتسميته «حاسوباً ذا برنامج مخزَّن» تشبيهٌ يجدر وسمه بذلك — فالبطاقات تحكّم خارجي، لا ذاكرةً قابلة للكتابة تحمل البرنامج والبيانات في مخزن واحد. النمط ليس مبنيّاً داخل الآلة؛ إنه مثقوب في سلسلة بطاقات تمرّ خلالها. غيّر البطاقات يتغيّر القماش. والآلة لا تعرف ماذا تنسج.

وبحلول ديسمبر ١٨٣٦ أحصت صحيفة «مانشستر غارديان» سبعة إلى ثمانية آلاف نول جاكار في بريطانيا. ولمّا وصف مِنابريا محرّك بابيج التحليلي بعد ذلك بست سنوات، ردّ على الاعتراض البديهي — أنك ستحتاج عدداً مستحيلاً من البطاقات — بالإشارة إلى صناعة النسيج:

قد يبدو العدد الهائل من البطاقات اللازمة لحل أي مسألة معقّدة عقبةً؛ لكن الأمر ليس كذلك على ما يبدو. لا حدّ لعدد البطاقات التي يمكن استخدامها. فبعض الأقمشة يتطلب نسجها ما لا يقل عن عشرين ألف بطاقة.
اعرض النصّ الأصلي

Perhaps the immense number of cards required for the solution of any rather complicated problem may appear to be an obstacle; but this does not seem to be the case. There is no limit to the number of cards that can be used. Certain stuffs require for their fabrication not less than twenty thousand cards.

L. F. Menabrea, Sketch of the Analytical Engine, 1842

وصاغ بابيج الفكرة بصورة أحدّ في مذكّراته: سواء كانت الخيوط بلون واحد أو بألوان، «فشكل النمط سيكون هو نفسه تماماً — والألوان وحدها تختلف». النمط مستقلّ عن المادة التي يتحقّق فيها. هذا هو الفصل بين البرنامج والبيانات، مصوغاً سنة ١٨٦٤، عن القماش.

حاسوب بابيج الذي بقي على الورق

تصميم لحاسوب عامّ الغرض، من النحاس، في ثلاثينيات القرن التاسع عشر. لم يُبنَ قط، وأسباب ذلك بشرية أكثر منها تقنية.

حصل تشارلز بابيج على نحو سبعة عشر ألفاً ونصف من الجنيهات من المال العام لأجل «محرّك الفروق» — والمقارنة التي يقدّمها متحف العلوم هي أن ذلك كان ثمن اثنتين وعشرين قاطرة بخارية جديدة من مصنع روبرت ستيفنسون سنة ١٨٣١. وكانت الآلة قد أُنجزت بمقدار السُّبع تقريباً حين توقّف العمل سنة ١٨٣٣، بعد أن ألقى مهندسه جوزيف كليمنت أدواته إثر خلاف حول من يدفع تكلفة نقل ورشته قريباً من بيت بابيج. وأُذيب اثنا عشر ألف قطعة دقيقة الصنع خردةً فيما بعد.

توقّف مشروع آلة كان يمكن أن تغيّر العالم بسبب خلاف على كلفة نقل الورشة.

ثم صمّم شيئاً أشدّ طموحاً بكثير، في الخفاء غالباً، على الورق، ولم يطلب من أحد تمويله جدّياً قط. وللمحرّك التحليلي جزآن سمّاهما «المخزن» و«المطحنة»:

أولاً: «المخزن»، وفيه تُوضَع جميع المتغيرات المراد إجراء العمليات عليها، وكذلك كل المقادير الناتجة عن عمليات أخرى. ثانياً: «المطحنة»، وإليها تُجلَب دائماً المقادير المراد إجراء العمليات عليها.
اعرض النصّ الأصلي

1st. The store in which all the variables to be operated upon, as well as all those quantities which have arisen from the result of other operations, are placed. 2nd. The mill into which the quantities about to be operated upon are always brought.

Charles Babbage, Passages from the Life of a Philosopher, 1864, ch. VIII

ذاكرة ومعالج. وقد حدّد ألف متغيّر بخمسين رقماً لكلٍّ منها، وعملية جمع في الثانية، ثم — وهذه هي الجملة التي تجعله حاسوباً لا آلة حاسبة — التفرّع الشرطي: يمكن تقديم البطاقات أو إرجاعها «بأي قدر»، وفق شروط، مع عدد غير محدود من المسارات الممكنة.

أسماء بابيج في الأعلى وأسماؤنا تحتها. والترتيب هو نفسه الذي استخدمه كل حاسوب منذئذ.

الأرقام التي بُني عليها هذا المخطّط
1. البطاقاتالبرنامج
2. التحكّمترتيب التعليمات، ومنها التفرّع
3. المطحنةالمعالج
4. المخزنالذاكرة — ألف عدد بخمسين رقماً
5. الطابعةالإخراج
Babbage, Passages from the Life of a Philosopher, 1864, ch. VIII
الذاكرة ١٠٠٠ متغيّر يحمل كلٌّ منها عدداً حتى خمسين رقماً عشرياً.
السرعة ٦٠ عملية جمع في الدقيقة عملية جمع في الثانية، مطبوعة. وضربٌ لعددين من خمسين رقماً في الدقيقة.
التفرّع شرطي، غير محدود يمكن تقديم البطاقات أو إرجاعها بأي قدر، وفق شروط. هذه هي الجملة التي تجعله حاسوباً لا آلة حاسبة.
ما بُني منه لا شيء أكثر من ثلاثين مجموعة رسومات لتعديلات بنيوية. لم يكفّ عن إعادة تصميمه.

وكتب أيضاً أفضل وصف لمعالج أخطاء كتبه أحد منذئذ:

سيرفض المحرّك دائماً أي بطاقة خاطئة، فيقرع جرساً عالياً بلا انقطاع ويوقف نفسه إلى أن يُزوَّد بالغذاء الفكري الدقيق الذي يطلبه.
اعرض النصّ الأصلي

The Engine will always reject a wrong card by continually ringing a loud bell and stopping itself until supplied with the precise intellectual food it demands.

Babbage, Passages, 1864, ch. VIII

ولم يُبنَ قط، لأربعة أسباب مرتّبة من الأكثر تأثيراً إلى الأقل: انهيار التمويل سنة ١٨٣٣ قوّض ثقة المموّلين بالمشروع؛ ولم يسعَ جدّياً إلى تمويل الآلة الثانية؛ ولم يكفّ عن إعادة تصميمها، فأنتج «أكثر من ثلاثين» مجموعة رسومات بنيوية؛ والهندسة كانت على حافة الممكن. على الحافة — لا وراءها. فبين ١٩٨٥ و٢٠٠٢ بنى متحف العلوم «محرّك الفروق رقم ٢» من رسوماته: ثمانية آلاف قطعة، وخمسة أطنان، وبمقاس مترين في ثلاثة ونصف تقريباً. وحكمهم أربع كلمات: «الآلة المكتملة تعمل كما أراد بابيج».

لم يكن التصميم هو المشكلة قط. مُوِّل، ثم هُجر وقد أُنجز سُبعه، ثم بُني بنجاح بعد ١٥٨ سنة.

الأرقام التي بُني عليها هذا المخطّط
المصمَّم، ١٨٢٢25,000
المبني قبل توقّف التمويل، ١٨٣٢~2,000
ما أُذيب خردةً~12,000
بناء متحف العلوم، ١٩٩١8,000
Science Museum, London; Computer History Museum

ولمّا نفد المال كتبت إليه أمّه:

يا بنيّ العزيز، لقد تقدّمت كثيراً في إنجاز هدف عظيم يليق بطموحك، وأنت قادر على إتمامه. ونصيحتي أن تمضي فيه، ولو اضطرك ذلك إلى العيش على الخبز والجبن.
اعرض النصّ الأصلي

My dear son, you have advanced far in the accomplishment of a great object, which is worthy of your ambition. You are capable of completing it. My advice is — pursue it, even if it should oblige you to live on bread and cheese.

Babbage, Passages, 1864, ch. VIII

آدا لوفليس، والسؤال الذي يتشاجر الناس حوله

التقت أوغستا آدا كينغ، كونتيسة لوفليس، ببابيج وهي في السابعة عشرة، سنة ١٨٣٣. وبعد عشر سنوات ترجمت مذكّرة فرنسية عن محرّكه وألحقت بها سبع ملاحظات من عندها، وقّعتها «أ. أ. ل». وملاحظاتها تبلغ نحو ثلاثة أضعاف طول الورقة التي كانت تترجمها.

واثنان مما كتبته فيها لم يخطرا لأحد، بمن فيهم بابيج. الأول هو النول:

يصحّ لنا أن نقول، بأدقّ تعبير، إن المحرّك التحليلي «ينسج أنماطاً جبرية» تماماً كما ينسج نول جاكار الأزهار والأوراق.
اعرض النصّ الأصلي

We may say most aptly, that the Analytical Engine weaves algebraical patterns just as the Jacquard-loom weaves flowers and leaves.

Ada Lovelace, Note A, Scientific Memoirs III, 1843

والثاني هو ما ينبغي أن يوقفك. فبعد أن قرّرت أن المحرّك يعالج رموزاً لا مقادير، سألت: وماذا أيضاً يمكن التعبير عنه بعلاقات بين رموز؟ فأجابت:

فلو افترضنا، مثلاً، أن العلاقات الأساسية بين الأصوات ذات الدرجات في علم الهارموني والتأليف الموسيقي قابلة لمثل هذا التعبير والتكييف، لأمكن للمحرّك أن يؤلّف قطعاً موسيقية متقنة وعلمية، بأي درجة من التعقيد أو الامتداد.
اعرض النصّ الأصلي

Supposing, for instance, that the fundamental relations of pitched sounds in the science of harmony and of musical composition were susceptible of such expression and adaptations, the engine might compose elaborate and scientific pieces of music of any degree of complexity or extent.

Ada Lovelace, Note A, 1843

آلة تؤلّف الموسيقى. سنة ١٨٤٣. لأنها أدركت أنك إن استطعت ترميز العلاقات، فلا يهمّ المحرّكَ عمَّ تدور تلك العلاقات.

ثم هناك «الملاحظة ز»، التي تُقتبس باستمرار وتُبتَر دائماً تقريباً. وهذه هي مع الجملتين اللتين تُحذفان عادةً:

من المستحسن الاحتراز من احتمال نشوء تصوّرات مبالغ فيها عن قدرات المحرّك التحليلي. ففي النظر إلى أي موضوع جديد يوجد ميل متكرر، أولاً إلى المبالغة في تقدير ما نجده مثيراً أو لافتاً بالفعل، وثانياً — بردّ فعل طبيعي — إلى بخس الحقيقة حقّها حين نكتشف أن تصوّراتنا تجاوزت ما يمكن الدفاع عنه فعلاً. ليس للمحرّك التحليلي أي ادّعاء البتة بأنه يبتكر شيئاً. إنه يستطيع أن يفعل كل ما نعرف كيف نأمره بأدائه. يستطيع أن يتبع التحليل، لكن لا قدرة له على استباق أي علاقات أو حقائق تحليلية.
اعرض النصّ الأصلي

It is desirable to guard against the possibility of exaggerated ideas that might arise as to the powers of the Analytical Engine. In considering any new subject, there is frequently a tendency, first, to overrate what we find to be already interesting or remarkable; and, secondly, by a sort of natural reaction, to undervalue the true state of the case, when we do discover that our notions have surpassed those that were really tenable. The Analytical Engine has no pretensions whatever to originate anything. It can do whatever we know how to order it to perform. It can follow analysis; but it has no power of anticipating any analytical relations or truths.

Ada Lovelace, Note G, 1843

مقروءةً كاملةً ليست هذه إنكاراً لإبداع الآلة. إنها تحذير من المبالغة في تقدير موضوع جديد، ثم — بردّ فعل طبيعي — من بخسه حقّه. وهذا، حرفياً، شكل كل جدل عامّ عن الذكاء الاصطناعي منذ ٢٠٢٢.

هل كانت أول مبرمِجة؟

هذا موضع خلاف حقيقي بين باحثين جادّين، والجواب الصادق أكثر إثارة للاهتمام من أي شعار. وهذه الأدلة من الجهتين.

ما يؤيّد

  • مثال أعداد برنولي كان فكرتها. كتبت إلى بابيج في يوليو ١٨٤٣: «أريد أن أُدخل شيئاً عن أعداد برنولي في إحدى ملاحظاتي، مثالاً على كيفية استخراج دالة ضمنية بواسطة المحرّك».
  • رواية بابيج نفسه تقول إن العمل الجبري كان لها، عدا أعداد برنولي التي عرض هو القيام بها ليوفّر عليها العناء — فأعادتها إليه بعد أن اكتشفت «خطأً جسيماً» في طريقته.
  • مخطّط الملاحظة (ز) برنامجٌ فعلاً: يحسب B₈، ويتضمّن حلقات متداخلة بدورة متكرّرة من المتغيّرات، وقد اختارت طريقة معقّدة عن قصد «لإظهار قدرة المحرّك».
  • توماس ميسا (٢٠١٦): «في أضعف الأحوال، يمكننا أن نمنحها التأليف الأساسي لأول خوارزمية موجّهة لآلة حاسبة».

ما يعارض

  • دورون سويد، الذي قاد بناء «محرّك الفروق» في متحف العلوم: «الادّعاء الثالث (أنها أول مبرمِجة) مفهوم لكنه خاطئ».
  • وثّق آلان بروملي عشرات البرامج النموذجية التي كتبها بابيج بين ١٨٣٧ و١٨٤٠ — وكلها تسبق الملاحظات، وإن كانت أبسط بكثير.
  • يقول بابيج إن كتابة ورقة أصلية لم تخطر لها، وإن إضافة الملاحظات كانت اقتراحه هو.
  • ويبدو أن الجدول المنشور يعكس معاملَين في العملية الرابعة — فالأرقام العلوية هناك تدلّ على إصدارات السجلّات لا على الأسس، والمعكوسان هما ²V₅ و²V₄، والناتج يُخزَّن في ¹V₁₁. أما هل كان ذلك سهو لوفليس أم بابيج أم عامل المطبعة فلم يثبت قط، ولهذا فإن «أول خطأ برمجي» حكايةٌ أجمل مما هي دعوى.

حكمٌ تسنده الأدلة

تتضمّن «الملاحظة ز» أول خوارزمية نُشرت لآلة حاسبة عامّة الغرض. وكان بابيج قد كتب برامج أبسط غير منشورة قبل ذلك، وطريقة برنولي كانت في الأصل طريقته، عرضها ليوفّر عليها الجهد — فأعيدت إليه وقد صُوِّب فيها خطأ جسيم. أما ما هو لها وحدها بلا لبس فهو الإطار المفاهيمي: أن المحرّك يعمل على رموز وعلاقات لا على أعداد؛ وأنه بالتالي قد يعمل على أي شيء يمكن التعبير عنه بعلاقات، بما في ذلك الموسيقى؛ ثم ذلك التقرير الدقيق المحترز لما تستطيع مثل هذه الآلة أن تبتكره وما لا تستطيع. وهذه ليست حاشية على بابيج. إنها فكرة أكبر مما دوّنه بابيج يوماً.

كيف تحوّل المنطق إلى معادلات

بين ١٨٥٤ و١٩٣٦ حاول الرياضيون وضع الاستدلال كلّه على أساس آليّ. فأخفقوا، وهذا الإخفاق هو ما جعل الحواسيب ممكنة.

كان جورج بول عصاميّ التعليم، ومعلّم مدرسة خمس عشرة سنة قبل أن ينال أستاذية في كورك، ولم يكن يظنّ نفسه يمارس الهندسة. كان يظنّ أنه يعكس هندسة تصميم الله للعقل البشري. ويفتتح كتابه بقول ذلك:

غاية هذه الرسالة أن تبحث في القوانين الأساسية لتلك العمليات الذهنية التي يجري بها الاستدلال، وأن تعبّر عنها بلغة رمزية حسابية … وأخيراً أن تجمع، من عناصر الحقيقة التي تظهر في سياق هذا البحث، إشاراتٍ مرجّحة عن طبيعة العقل البشري وتكوينه.
اعرض النصّ الأصلي

The design of the following treatise is to investigate the fundamental laws of those operations of the mind by which reasoning is performed; to give expression to them in the symbolical language of a Calculus … and, finally, to collect from the various elements of truth brought to view in the course of these inquiries some probable intimations concerning the nature and constitution of the human mind.

George Boole, An Investigation of the Laws of Thought, 1854, ch. I §1

والقانون الذي وجده بسيط إلى حدّ مذهل. إن كان الرمز يدلّ على صنف من الأشياء، فإن ضمّه إلى نفسه لا يغيّر شيئاً — فالأشياء الطيّبة التي هي أشياء طيّبة هي أشياء طيّبة فحسب. كتبه هكذا: س² = س، وسمّاه «قانون الثنائية».

قانون الثنائية x² = x  →  x ∈ {0, 1}

والرموز هنا تدلّ على أصناف من الأشياء لا على أعداد، وهذا هو الجزء الذي يُتجاوَز عادةً. لكن اقرأ القانون لحظةً بوصفه جبراً عادياً، فلا يحقّقه إلا عددان: الصفر والواحد. وهذا تشبيه لا برهان — إذ يمكن لجبر بول أن يضمّ أكثر من عنصرين، ولا شيء هنا يثبت أن الفكر نفسه ثنائي القيمة. لكنه تشبيه بالغ الجودة. وبعد ثلاث وثمانين سنة لاحظ شابّ في الحادية والعشرين في «إم آي تي» أن المرحّل الكهربائي ثنائي القيمة أيضاً، فصار المنطق عتاداً.

اقرأ قانون بول جبراً عادياً فلن ينجو منه إلا عددان. وهذا تشبيه لا برهان عن الفكر — لكنه التشبيه الذي صار عتاداً.

الأرقام التي بُني عليها هذا المخطّط
xx²x² = x
000✓
111✓
224✗
339✗
Boole, An Investigation of the Laws of Thought, 1854, ch. II §9

وفي الأثناء كانت الأسس تتفكّك. اخترع غوتلوب فريغه المنطق الحديث سنة ١٨٧٩ — المسوّرات، والمتغيّرات المرتبطة، وأول حساب محمولات — ورسمه بترميز ثنائي البعد متشعّب لم يرغب أحد في صفّه مطبعياً، فغرق دون أثر يذكر. ثم، في ١٦ يونيو ١٩٠٢، وقد صار الجزء الثاني من ثمرة عمل حياته عند المطبعة، كتب إليه برتراند رَسِل رسالة مهذّبة يبيّن فيها أن نظامه يتضمّن تناقضاً. ولم يتعافَ فريغه تماماً بعدها قط.

وأثبت غيورغ كانتور سنة ١٨٧٤ أن الأعداد الحقيقية لا تُعدّ، ما يعني أن كل الأعداد تقريباً متسامية — أُثبت ذلك دون عرض عدد واحد منها. وفي ١٨٩١ أنتج «حجّة القُطر»، وهي التقنية التي سيعيد كلٌّ من غودل وتورنغ استعمالها لاحقاً. وقضى عقوداً يحاول ويخفق في حسم «فرضية الاستمرار»، يظنّ مراراً أنه ظفر ببرهان ثم يجد الخطأ، ومات في مصحّة سنة ١٩١٨. ومرجع «ماك تيوتر» دقيق في هذا وينبغي أن نكون مثله: همومه الرياضية ضخّمها اكتئابه، ولم تكن سببه.

الجملة التي جاءت في أكثر اللحظات مفارقةً

أراد ديفيد هيلبرت صَوْرَنة الرياضيات كلها، وإثبات اتّساقها بوسائل منتهية، وبيان أنها قابلة للحسم — أثمة خوارزمية تُجيب، عن أي عبارة، بنعم أو لا بحسب صحّتها الكلّية؟ سمّى هذا السؤال الأخير «مسألة الحسم».

وفي ٨ سبتمبر ١٩٣٠، في كونيغسبرغ، ألقى خطاب تقاعده. وأُذيع في الراديو. وختمه بقوله:

يجب أن نعرف. وسوف نعرف.
اعرض النصّ الأصلي

Wir müssen wissen. Wir werden wissen.

David Hilbert, Königsberg, 8 September 1930

هاتان الجملتان محفورتان على شاهد قبره في غوتنغن. وفي اليوم السابق، في طاولة مستديرة بالمدينة نفسها، كان شابّ في الرابعة والعشرين اسمه كورت غودل قد أعلن بهدوء أن ذلك مستحيل. وكان جون فون نويمان في القاعة، فأدرك الأمر فوراً.

ما أثبته غودل فعلاً، بدقّة

تقول مبرهنة غودل الأولى إن أي نظام صوري متّسق يمكن إجراء قدر معيّن من الحساب الابتدائي داخله هو نظام غير مكتمل: فيه عبارات من لغته لا يستطيع إثباتها ولا نفيها. وتقول الثانية إن مثل هذا النظام لا يستطيع إثبات اتّساقه هو. والثانية هي التي قتلت برنامج هيلبرت؛ وقد أدرك بول برنايز ذلك بحلول يناير ١٩٣١.

وثلاثة أمور لا تقولها المبرهنة، لأنها تُقال باستمرار. ليست عن حقائق لا يمكن إثباتها بمعنى مطلق — إنها تخصّ الاشتقاق داخل نظام صوري بعينه. وعبارة غودل التي «تقول عن نفسها إنها غير قابلة للإثبات» صورة تقريبية، وتحذّر موسوعة ستانفورد الفلسفية من أن مثل هذه الصور «توحي بأكثر مما ينبغي». ولم تُبطل المبرهنة الميكانيكية؛ وثمة إجماع واسع على أن الحجج المضادة للميكانيكية المستندة إلى غودل فاشلة.

والفرضيات هنا حاملة للبناء. فالأنظمة المتّسقة الأضعف من أن تُجري حساباً يمكن أن تكون مكتملة وقابلة للحسم — كحساب بريسبورغر، ونظرية الحقول الحقيقية المغلقة. وعبارة «أثبت غودل أن الرياضيات غير مكتملة» خاطئة كتعميم.

عدم الاكتمال يخصّ الاشتقاق داخل نظام بعينه، لا الحقيقة عموماً. والثلاثة تُختزل عادةً في واحد.

الأرقام التي بُني عليها هذا المخطّط
1. صادقيصدق في التأويل المقصود
2. قابل للإثبات داخل Fيمكن اشتقاقه من مسلّمات F
3. الفجوةعبارات صادقة وغير مشتقّة في F. وقد يشتقّها نظام F آخر أقوى
Stanford Encyclopedia of Philosophy, Gödel’s Incompleteness Theorems

كيف عرّف تورنغ الحوسبة والذكاء

ورقة واحدة تعرّف الحاسوب. وثانية، بعدها بأربع عشرة سنة، تعرّف الجدل الذي ما زلنا نخوضه عنه.

كانت مسألة هيلبرت في الحسم تحتاج إلى تعريف لـ«الإجراء الآلي» قبل أن يثبت أحد أنها بلا حلّ. وفي ١٩٣٦ قدّم آلان تورنغ تعريفاً، بأن سأل: ماذا يفعل الإنسان حين يحسب؟ ثم جرّد الجواب إلى أدنى حدّ.

يمكننا أن نشبّه «رجلاً في أثناء حسابه لعدد حقيقي» بآلة لا تقدر إلا على عدد محدود من الحالات … تُزوَّد الآلة بـ«شريط» (نظير الورق) يمرّ خلالها، مقسّم إلى أقسام (تُسمّى «مربّعات») يحمل كلٌّ منها «رمزاً».
اعرض النصّ الأصلي

We may compare a man in the process of computing a real number to a machine which is only capable of a finite number of conditions … The machine is supplied with a “tape” (the analogue of paper) running through it, and divided into sections (called “squares”) each capable of bearing a “symbol”.

A. M. Turing, On Computable Numbers, 1936, §1

وانتبه إلى ما هي آلة تورنغ. ليست عتاداً مقترحاً. إنها نموذج لكاتب بقلم رصاص، والمبرّر الذي يسوقه تورنغ لمحدوديّتها نازع للسلاح:

أكتفي الآن بالقول إن المبرّر يكمن في أن الذاكرة البشرية محدودة بالضرورة.
اعرض النصّ الأصلي

For the present I shall only say that the justification lies in the fact that the human memory is necessarily limited.

Turing, On Computable Numbers, 1936

ثم، في القسم السادس، جملة واحدة هي الحوسبة كلها:

من الممكن ابتكار «آلة واحدة» يمكن استخدامها لحساب أي متتالية قابلة للحساب.
اعرض النصّ الأصلي

It is possible to invent a single machine which can be used to compute any computable sequence.

Turing, On Computable Numbers, 1936, §6

آلة مدخلها وصفٌ لآلة أخرى. وهذا هو الأساس المفاهيمي للحاسوب ذي البرنامج المخزَّن، لا تصميمٌ له، وكل آلة عامّة الغرض بُنيت منذئذ هي حالة منه. وكان ألونزو تشرش قد بلغ نتيجة مكافئة قبله بستة أسابيع من طريق مختلف تماماً، عبر «حساب لامدا»؛ وعلم تورنغ بذلك وورقته تمرّ بإجراءات النشر، فأضاف ملحقاً يبرهن تكافؤ التعريفين. سبقه تشرش. وأحسن تورنغ، لأن نموذجه هو الذي تحوّل إلى آلات.

وملاحظة في المصطلح: لم يستخدم تورنغ قط عبارة «مسألة التوقّف». ما أثبته هو أنه لا يوجد إجراء عامّ يقرّر ما إذا كانت الآلة «خالية من الدوائر» — أي هل تمضي في طباعة الأرقام إلى الأبد. أما الاسم فجاء لاحقاً.

بلتشلي بارك: خلط شائع ينبغي تصحيحه

صمّم تورنغ «البُمب» البريطاني سنة ١٩٣٩ — طنّ واحد، وعرض متران، وستّ وثلاثون مكافئاً لآلة إنيغما، وأسطوانات تدور بمئة وعشرين دورة في الدقيقة، ونحو عشرين دقيقة لمسح كل مواضع الدوّارات البالغة ١٧٫٥٧٦. ولوحة غوردون ولشمان القُطرية جعلته أكفأ بكثير. وبناه هارولد كين. ولا يبدأ شيء من هذا دون ماريان ريفسكي ومكتب الشفرات البولندي، الذين كانوا يقرأون إنيغما الألمانية منذ سبع سنوات قبل أن يبدأ الجهد البريطاني.

ووصفت المشغّلات، وجُلّهنّ من «الرِنز»، تلك الآلات بأنها «أشبه بخزائن كتب معدنية ضخمة». وسمّاها الكابتن ونترباتم «إلهةً برونزية»، للونها. وغرفة ممتلئة بها تدور بمئة وعشرين دورة في الدقيقة كانت تصمّ الآذان.

صفوف من الصمّامات المفرّغة المتوهّجة في رفّ معدني.
صمّامات مفرّغة مصفوفة. اقترح تومي فلاورز ألفاً وستمئة منها حين كان الرقم القياسي مئة وخمسين، فلم يُصدَّق.

أما «كولوسوس» فكان آلة شخص آخر، موجّهة إلى شفرة أخرى. كان تومي فلاورز ابن بنّاء، درس مساءً في جامعة لندن والتحق بهيئة البريد سنة ١٩٢٦. ولمّا اقترح آلة بألف وستمئة صمّام لم يصدّقه أهل بلتشلي — إذ كان أعقد جهاز إلكتروني حتى ذلك الحين يستخدم نحو مئة وخمسين — فبناها بماله الخاص جزئياً. وبدأت تحليل أول رسالة مشفّرة في ٥ فبراير ١٩٤٤. ودخلت النسخة الثانية، بألفين وأربعمئة صمّام، الخدمة في الثامنة صباحاً من ١ يونيو ١٩٤٤، قبل إنزال النورماندي بخمسة أيام.

وبعد الحرب أُمر بإتلافها:

أخذت كل الرسومات والمخططات وكل ما كُتب عن «كولوسوس» على الورق، وألقيت به في نار المرجل.
اعرض النصّ الأصلي

I took all the drawings and the plans and all the information about Colossus on paper and put it in the boiler fire.

Tommy Flowers, on the postwar order to destroy Colossus

وأُعطي ألف جنيه. وتقدّم إلى بنك إنجلترا بطلب قرض لبناء آلة أخرى مثل كولوسوس فرُفض، لأن البنك لم يصدّق أن مثل هذه الآلة يمكن أن تعمل — وقانون أسرار الدولة منعه من أن يخبرهم أنه بنى منها عشراً. وبقيت القصة سرّية حتى منتصف السبعينيات، ولم تُفرج تفاصيلها كاملةً حتى سنة ٢٠٠٠. ومات فلاورز سنة ١٩٩٨.

١٩٥٠: «الآلات الحاسبة والذكاء»

يفتتح تورنغ برفض السؤال. فالسؤال عمّا إذا كانت الآلات تفكّر، معرَّفاً بحسب استعمال الناس للكلمات، يقود إلى «مسح إحصائي كاستطلاع غالوب. وهذا عبث». فيستبدل به لعبة — وهنا سطّحت الرواية الشائعة شيئاً يستحقّ الاحتفاظ به.

لعبة المحاكاة كما يعرّفها تورنغ ليست آلة في مواجهة إنسان. إنها رجل وامرأة ومحقّق، ومهمّة المحقّق أن يميّز أيّهما أيّ، بينما يحاول الرجل أن يُظنّ امرأة. والأجوبة تُطبع على الآلة الكاتبة؛ و«الترتيب المثالي أن يكون هناك جهاز تلغراف طابع يصل بين الغرفتين». وعندئذ فقط يسأل تورنغ: ماذا يحدث لو حلّت آلة محلّ الرجل؟

فأول توصيف لاختبار ذكاء آليّ يجري إذن نصّاً، عبر نافذة محادثة، سنة ١٩٥٠ — وخطّ الأساس لخداع الآلة هو رجل يتظاهر بأنه امرأة. وكلا التفصيلين بديع، وكلاهما يُمحى عادةً.

الاختبار الأصلي لعبة محاكاة بين رجل وامرأة تُلعب بجهاز تلغراف طابع، ثم تحلّ الآلة محلّ الرجل. وكلا التفصيلين يُمحى عادةً.

الأرقام التي بُني عليها هذا المخطّط
1. أ — رجليحاول أن يُظنّ المرأة
2. ب — امرأةتحاول مساعدة المحقّق
3. ج — المحقّقفي غرفة أخرى، يقرأ أجوبة مطبوعة
4. الاستبدالضع الآن آلة مكان «أ» واسأل: هل يخطئ «ج» بالقدر نفسه؟
Turing, Computing Machinery and Intelligence, Mind 59:236, 1950

ثم التنبّؤ:

أعتقد أنه بعد نحو خمسين عاماً سيكون بالإمكان برمجة حواسيب بسعة تخزين تقارب ١٠⁹ لتلعب لعبة المحاكاة ببراعة تجعل حظّ محقّق متوسط في التعرّف الصحيح لا يتجاوز سبعين بالمئة بعد خمس دقائق من الأسئلة.
اعرض النصّ الأصلي

I believe that in about fifty years’ time it will be possible, to programme computers, with a storage capacity of about 10⁹, to make them play the imitation game so well that an average interrogator will not have more than 70 per cent chance of making the right identification after five minutes of questioning.

A. M. Turing, Computing Machinery and Intelligence, Mind 59:236, 1950

احسبها: عشرة أس تسعة من البتّات تساوي نحو ١٢٥ ميغابايت. فمعيار تورنغ لآلة تفكّر كان ثُمن غيغابايت — ويشير في الورقة نفسها إلى أن «الموسوعة البريطانية» تبلغ نحو ضعف ذلك. وقدّر الجهد أيضاً: «بمعدّل عملي الحالي أنتج نحو ألف رقم من البرنامج يومياً، فنحو ستين عاملاً يشتغلون بانتظام طوال الخمسين سنة قد ينجزون المهمّة، إن لم يذهب شيء إلى سلّة المهملات».

كان معيار تورنغ لآلة تفكّر ثُمن غيغابايت. لم يخطئ في الآلية؛ أخطأ في المقياس بستّ مراتب عشرية.

الأرقام التي بُني عليها هذا المخطّط
تقدير تورنغ، ١٩٥٠125 MB
الموسوعة البريطانية، ط١١250 MB
أوزان GPT-2، ٢٠١٩6 GB
أوزان GPT-3، ٢٠٢٠350 GB
Turing 1950; model sizes from the compute table in this guide

ويسمّي اعتراض لوفليس صراحةً، ويخطئ في اقتباسه مرتين، ثم يفعل شيئاً كريماً: بدل أن يسجّل نقطة، يلاحظ أن لوفليس لم تجزم بأن الآلات تفتقر إلى الصفة، بل بأن الأدلة المتاحة لها لم تعطها سبباً للاعتقاد بأنها تملكها — ثم يضيف: «وعلى أي حال، لم يكن عليهما أي التزام بادّعاء كل ما يمكن ادّعاؤه».

أما قسم «الآلات المتعلّمة» فهو حيث يتعيّن على قارئ اليوم أن يجلس. يقترح تدريب طفل بدل برمجة بالغ:

بدل محاولة إنتاج برنامج يحاكي عقل البالغ، لماذا لا نحاول إنتاج واحد يحاكي عقل الطفل؟ … فدماغ الطفل، على الأرجح، أشبه بدفتر تشتريه من المكتبة: آليّة قليلة، وصفحات بيضاء كثيرة.
اعرض النصّ الأصلي

Instead of trying to produce a programme to simulate the adult mind, why not rather try to produce one which simulates the child’s? … Presumably the child brain is something like a notebook as one buys it from the stationer’s. Rather little mechanism, and lots of blank sheets.

Turing, Computing Machinery and Intelligence, 1950

ويفصل بين الحالة الابتدائية للعقل، والتعليم الذي يتلقّاه، والخبرات الأخرى — أي التدريب المسبق، والضبط الدقيق، وما عداهما. ثم يصف التعلّم المعزَّز:

ينبغي أن تُبنى الآلة بحيث تصير الأحداث التي سبقت إشارة العقاب بقليل غير مرجّحة التكرار، بينما تزيد إشارة المكافأة احتمال تكرار الأحداث التي أفضت إليها.
اعرض النصّ الأصلي

The machine has to be so constructed that events which shortly preceded the occurrence of a punishment signal are unlikely to be repeated, whereas a reward signal increased the probability of repetition of the events which led up to it.

Turing, Computing Machinery and Intelligence, 1950

ويشير إلى الحدّ المعلوماتي للتدريب بالمكافأة وحدها، ويلاحظ أن طفلاً يتعلّم بالعقاب فقط «سيتألّم كثيراً على الأرجح»، ويخلص إلى ضرورة وجود قنوات اتصال أخرى «غير انفعالية». ويوصي بإدخال عنصر عشوائي، لأن فضاء الحلول المُرضية واسع بما يجعل البحث العشوائي أفضل من المنهجي. ثم يمدّ يده إلى استعارة ينبغي أن توقف أي قارئ في ٢٠٢٦:

وثمة تشبيه آخر: مفاعل نووي دون الكتلة الحرجة؛ الفكرة المحقونة تقابل نيوتروناً يدخل الكومة من الخارج … أما إذا زيد حجم الكومة بما يكفي، فالاضطراب الذي يحدثه ذلك النيوترون سيغلب أن يمضي في التزايد بلا توقّف … فهل يمكن جعل آلة «فوق حرجة»؟
اعرض النصّ الأصلي

Another simile would be an atomic pile of less than critical size: an injected idea is to correspond to a neutron entering the pile from without … If, however, the size of the pile is sufficiently increased, the disturbance caused by such an incoming neutron will very likely go on and on increasing … Can a machine be made to be supercritical?

Turing, Computing Machinery and Intelligence, 1950

سنة ١٩٥٠ وصف تورنغ «فرضية التوسّع» بمفاعل نووي.

وآخر فقرة نشرها في الموضوع تسمّي طريقين: علّم الآلة لعبة مجرّدة كالشطرنج، أو زوّدها بأفضل المستشعرات التي يمكن توفيرها ثم علّمها الإنجليزية كما يُعلَّم الطفل، بالإشارة إلى الأشياء وتسميتها. «وأرى أن الطريقين يستحقّان التجربة». وقد أمضى الحقل أربعين سنة في الطريق الأول. أما الطريق الثاني فهو النموذج اللغوي الكبير.

لا نرى أمامنا إلا مسافة قصيرة، لكننا نرى فيها الكثير مما ينبغي عمله.
اعرض النصّ الأصلي

We can only see a short distance ahead, but we can see plenty there that needs to be done.

Turing, Computing Machinery and Intelligence, 1950 — the last line

النهاية

في ٣١ مارس ١٩٥٢ أُدين تورنغ بـ«الفحش الجسيم» بموجب القانون نفسه الصادر سنة ١٨٨٥ الذي أُدين به أوسكار وايلد. وخُيّر بين السجن والخضوع للمراقبة القضائية مع علاج هرموني، فاختار الثاني: سنة من حقن إستروجين اصطناعي سبّبت له العجز ونموّ أنسجة ثديية. ومات في ٧ يونيو ١٩٥٤ عن إحدى وأربعين سنة، مسموماً بالسيانيد. وسجّل التحقيق «انتحاراً».

واعتذر غوردون براون سنة ٢٠٠٩. وصدر عفو ملكي في ٢٤ ديسمبر ٢٠١٣، متأخّراً تسعاً وخمسين سنة.

من النظرية إلى أول الحواسيب

بين ١٩٣٧ و١٩٥٦ تصل القطع كلها في وقت متقارب، في خمس دول، وأصحابها في الغالب لا يتحدّثون إلى بعضهم.

شانون، ثلاث مرات

سنة ١٩٣٧ أثبت طالب ماجستير في الحادية والعشرين في «إم آي تي» أن جبر بول المنطقي لسنة ١٨٥٤ يصف دوائر المرحّلات الكهربائية وصفاً تامّاً. المغلق واحد، والمفتوح صفر، والتوالي «و»، والتوازي «أو» — وبالعكس، يمكنك استخدام دوائر المرحّلات لحلّ مسائل في جبر بول. ووصفها هوارد غاردنر لاحقاً بأنها «ربما أهمّ رسالة ماجستير في القرن وأشهرها». وكان شانون قد أخذ في البكالوريوس مقرّراً في الفلسفة تصادف أنه غطّى بول، ثم ذهب إلى «إم آي تي» ليشغّل حاسوباً تناظرياً بحجم غرفة مليئاً بالمرحّلات. كان الشخص الوحيد على الأرض الذي يملك النصفين معاً.

وسنة ١٩٤٨ أسّس نظرية المعلومات، وأعطانا كلمة «بت» (ناسباً الاقتراح إلى ج. و. توكي)، وقال الجملة التي اضطرّ كل جدل عن فهم الآلة أن يحاسب نفسه عليها منذئذ:

المشكلة الأساسية في الاتصال هي إعادة إنتاج رسالة اختيرت في نقطة ما، عند نقطة أخرى، بدقّة أو بالتقريب. وكثيراً ما يكون للرسائل معنى … لكن هذه الجوانب الدلالية للاتصال لا صلة لها بالمسألة الهندسية.
اعرض النصّ الأصلي

The fundamental problem of communication is that of reproducing at one point either exactly or approximately a message selected at another point. Frequently the messages have meaning … These semantic aspects of communication are irrelevant to the engineering problem.

Claude Shannon, A Mathematical Theory of Communication, 1948

تلك الجملة إما أنصع قرار هندسي في القرن، وإما الخطيئة الأولى لهذا الحقل، بحسب من تسأل — وكلا القراءتين نجا من ثمانية وسبعين عاماً من الجدل.

وسنة ١٩٥١ قاس إنتروبيا الإنجليزية باستخدام البشر أنفسهم نموذجاً لغوياً: أرِ المشارك نصّاً حتى نقطة، واجعله يخمّن الحرف التالي، وسجّل عدد المحاولات. أحد المشاركين أصاب ٧٩ من ١٠٢ حرف من المحاولة الأولى. وخلاصته — أن الإنجليزية بسياق مئة حرف تعمل عند نحو ٠٫٦ إلى ١٫٣ بتّ للحرف — لا تزال الرقم الذي تُقاس عليه نتائج مقياس الارتباك (perplexity) في النماذج اللغوية.

الدماغ بوصفه دائرة منطقية

في ديسمبر ١٩٤٣ اقترح وارن مكولوك ووالتر بيتس أن العصبون وحدة عتبة ثنائية: خُذ مدخلات موزونة، واجمعها، وأطلق إشارة إن تجاوز المجموع عتبةً. وشبكات من هذه الوحدات تستطيع حساب كل الدوال المنطقية، بل — إذا زُوّدت بشريط ورؤوس قراءة وكتابة — تكافئ آلة تورنغ. وكل شبكة عصبية اصطناعية تنحدر من هذه الورقة.

وكان بيتس قد هرب من بيته في ديترويت في الخامسة عشرة، وظهر في جامعة شيكاغو، وتقدّم إلى رودولف كارناب بقائمة تصويبات لكتابه، ثم درس على يديه. وعاش بلا مأوى فترة. ولم يكن يحمل شهادة — ولا حتى شهادة ثانوية — حين شارك في كتابة إحدى الأوراق المؤسِّسة لحقلين، وهو في العشرين.

واستشهد بها جون فون نويمان بوصفها نتيجة مهمّة، وعناصر المنطق في تقريره عن «إدفاك» سنة ١٩٤٥ تُسمّى «عناصر E»، مصمَّمة صراحةً على غرار عصبونات مكولوك–بيتس. أول وثيقة معمارية لحاسوب في التاريخ تصف بوّاباتها المنطقية بأنها عصبونات.

التقرير الذي سمّى معمارية ودمّر براءة اختراع

كتب فون نويمان «المسوّدة الأولى لتقرير عن إدفاك» بخطّ يده وهو في القطار إلى لوس ألاموس. وطبعها هرمان غولدستاين وأرسل منها أربعاً وعشرين نسخة في ٢٥ يونيو ١٩٤٥، باسم فون نويمان وحده. وهي أول وصف منشور لمفهوم البرنامج المخزَّن، وهي التي أعطت المعمارية اسمه.

وهي أيضاً التي دمّرت براءة الاختراع. فالتوزيع العلني قبل تقديم الطلب بأكثر من سنة شكّل إفصاحاً سابقاً، وجعل براءة «إدفاك» غير قابلة للإنفاذ. أما ج. بريسبر إيكرت وجون موكلي، اللذان طمس التأليف المنفرد إسهامهما، وادّعى فريقهما أن المفهوم نشأ في اجتماعات سابقة لانضمام فون نويمان، فلم يسامحاه قط.

«إنياك»، والنساء الستّ اللواتي لم يُدعَين إلى العشاء

ثلاثون طنّاً، ونحو ثمانية عشر ألف صمّام مفرّغ، ونحو خمسة ملايين وصلة لحام، ومئة وخمسون كيلوواط. ويقدّم تاريخ الجيش الأمريكي نفسه مقارنة واحدة نظيفة: مسار مدّته ستون ثانية كان يستغرق نحو عشرين ساعة على آلة حاسبة مكتبية بيد مشغّل ماهر، وثلاثين ثانية على «إنياك». وكان يفقد صمّاماً كل يوم أو يومين؛ وانتهى الطاقم إلى استبداله في خمس عشرة دقيقة. أُعلن عنه على الصفحة الأولى من «نيويورك تايمز» في ١٤ فبراير ١٩٤٦.

وبرمجَته ستّ نساء: كاثلين مكنالتي، وبيتي جين جينينغز، وفرانسيس إليزابيث سنايدر، ومارلين وِسكوف، وفرانسيس بيلاس، وروث ليخترمان. لم تكن هناك لغة برمجة، ولا دليل، ولا برنامج مخزَّن، ولا تعليمات تشغيل. درسن المخططات والبنية المادية ليكتشفن كيف تُدار مفاتيحه وكوابله. وكانت إعادة تهيئة الآلة لمسألة جديدة تستغرق أياماً.

وعند تتبّع الأعطال وتصحيحها يحسم السجلّ أي سؤال عن عمقهنّ التقني: كنّ في الغالب قادرات على حصر العطل في صمّام بعينه، فيُشِرن إليه ليستبدله فنّي. كنّ ينظرن إلى رقم خاطئ يخرج من آلة طولها ثلاثون متراً فيخبرنك أيّ صمّام من ثمانية عشر ألفاً قد مات.

وكتبت بيتي سنايدر وجين جينينغز برنامج العرض للإطلاق العلني — مسار قذيفة يُحسب في خمس عشرة ثانية، في وقت أقصر من الزمن الذي استغرقته القذيفة في الطيران، وهي مهمّة كانت ستستغرق حاسبة بشرية أسابيع. ونسب هرمان وأديل غولدستاين الفضل إلى نفسيهما. ولم تُدعَ أيّ من الستّ إلى حفل التدشين الرسمي ولا إلى العشاء بعده. وصُنّفن «دون المهنيّات» بينما صُنّف رجال بشهادات رياضيات مماثلة «مهنيّين».

كان يوم تقديم «إنياك» إلى العالم من أكثر أيام حياتي إثارة. كان العرض رائعاً. حسب «إنياك» المسار في وقت أقصر من الزمن الذي استغرقته القذيفة في الطيران نفسها.
اعرض النصّ الأصلي

The day ENIAC was introduced to the world was one of the most exciting days of my life. The demonstration was fabulous. ENIAC calculated the trajectory faster than it took the bullet to travel.

Jean Jennings Bartik, one of the six ENIAC programmers

وفي غرفة معيشة في برلين

قدّم كونراد تسوزه آلة «Z3» في ١٢ مايو ١٩٤١: نحو ٢٦٠٠ مرحّل، وفاصلة عائمة ثنائية بـ٢٢ بتّاً، و٦٤ كلمة ذاكرة، وتردّد خمسة إلى عشرة هرتز، وبرامج على شريط مثقوب خارجي — أي بلا إعادة توصيل بين برنامج وآخر، وهذا بالضبط ما لم يقدر عليه «إنياك». بنى آلاته الأولى في غرفة معيشة والديه، خارج المؤسسة البحثية، وفي جهل شبه تامّ بتورنغ وشانون وبابيج، وتوصّل إلى الفاصلة العائمة الثنائية مستقلاً.

سبق «إنياك» بخمس سنوات تقريباً، وكان أبطأ منه بنحو ألف مرة لأنه مرحّلات لا صمّامات. وأثبت راؤول روخاس سنة ١٩٩٨ أن Z3 مكتمل من حيث تورنغ «من حيث المبدأ»، لكن عبر تركيب يستخدم التنفيذ التخميني لم يستعمله تسوزه ولم يكن ليتعرّف عليه؛ إذ لم يكن فيه تفرّع شرطي عملي. وفي ٢١ ديسمبر ١٩٤٣ دمّرته غارة جوية للحلفاء. ثم كُتب تاريخ الحوسبة بالإنجليزية.

المرحّلات في مواجهة الصمّامات. سبق تسوزه «إنياك» بخمس سنوات وكان أبطأ منه بنحو ألف مرة، وهذه حجّة الإلكترونيات كلها في صفّ واحد.

الأرقام التي بُني عليها هذا المخطّط
المحرّك التحليلي، صُمّم ١٨٣٧1 (on paper)
تسوزه Z3، ١٩٤١ — مرحّلات~1.25
كولوسوس ٢، ١٩٤٤ — صمّامات25,000 chars/sec
إنياك، ١٩٤٥ — صمّامات5,000
Deutsches Museum; Penn Engineering; The National Museum of Computing

التسمية، ١٩٥٦

احتاج جون مكارثي إلى عبارة لمقترح ورشة صيفية في كلية دارتموث، فاختار عبارة تتفادى معسكر «السيبرنطيقا» القائم وخلافاته. اختار «الذكاء الاصطناعي». وادّعى المقترح أن تقدّماً كبيراً يمكن إحرازه في صيف واحد بعشرة رجال. وقد انعقدت الورشة. أما التقدّم فلا.

شتاءا الذكاء الاصطناعي ومن واصلوا العمل

خمسون سنة وعد فيها الحقل بأكثر مما يستطيع مرّتين، وفقد تمويله مرّتين، وأبقاه حيّاً نفرٌ قيل لهم إنهم يهدرون حياتهم المهنية.

بنى فرانك روزنبلات «البِرسبترون» سنة ١٩٥٨ — آلة متعلّمة، موصولة مادياً، تعدّل أوزانها حتى تصنّف تصنيفاً صحيحاً. وكانت التغطية الصحفية مبالغاً فيها، ومن هناك تبدأ العادة الحديثة في الترويج المبالغ فيه.

وفي ١٩٦٩ نشر مارفن مينسكي وسيمور بابرت كتاب «برسبترونات»، مبيّنين أن برسبتروناً بطبقة واحدة لا يستطيع حساب دالة «أو الحصرية». ويُروى هذا عادةً على أنه أثبت عقم الشبكات العصبية وتسبّب في شتاء الذكاء الاصطناعي الأول، وليس هذا ما يقوله الكتاب. فالبرهان يخصّ الشبكات أحادية الطبقة؛ أما التشاؤم بشأن الشبكات متعددة الطبقات فكان حدساً مصرَّحاً بأنه حدس، لا مبرهنة. والشبكات متعددة الطبقات مع الانتشار الخلفي تفعل بالضبط ما قيل إن الكتاب استبعده. والصحيح أن تلقّي الكتاب، أكثر من محتواه، جفّف تمويل الشبكات العصبية عقداً كاملاً.

وغرق روزنبلات في حادث قارب سنة ١٩٧١، في عيد ميلاده الثالث والأربعين. لم يمت من القهر، والرواية التي تقول ذلك نهايةٌ روائية طُعّمت على نهاية حقيقية.

«إليزا»، والمرآة

كتب جوزيف وايزنباوم «إليزا» في منتصف الستينيات: بضع مئات من الأسطر تعيد جملك إليك على هيئة أسئلة، على طريقة معالج روجرزي. لم تكن تفهم شيئاً على الإطلاق. ومع ذلك باح لها الناس بأسرارهم، مطوّلاً، وطلبوا أن يُتركوا معها على انفراد. وقد اضطرب وايزنباوم من ذلك حتى أمضى شطراً كبيراً من بقية حياته يجادل ضدّ الحقل الذي أسهم فيه.

وسُمّي الأثر باسمها. وكل نقاش عمّا إذا كان روبوت المحادثة يفهمك هو، جزئياً، نقاش عن برنامج من سنة ١٩٦٦ لم يكن فيه معلومة واحدة.

القواعد، والخبراء، والشتاء الثاني

كان جواب الثمانينيات هو تدوين المعرفة: «النظم الخبيرة»، آلاف القواعد المصوغة يدوياً تُرمّز ما يعرفه المتخصّص. وقد نجح بعضها تجارياً. لكنها جميعاً تبيّن أنها هشّة عند الحواف، ويستحيل صيانتها مع تفاعل القواعد، وعاجزة عن تعلّم أي شيء. وانهار التمويل مجدّداً نحو سنة ١٩٨٧، آخذاً معه صناعة عتاد «ليسب» المتخصّصة.

وثمة قصة من تلك الحقبة تستحقّ التصويب لأنها تُستخدم سلاحاً. يُنسب إلى فريدريك يلينك، الذي قاد التعرّف على الكلام في «آي بي إم»، قوله: «كلما طردت لغوياً ارتفع أداء نظام التعرّف على الكلام». لم يطرد لغوياً قط. الجملة نكتة عن المنهج — أن الإحصاء من البيانات يتفوّق على القواعد اليدوية — تكرّرت حتى صارت قصة عن التوظيف.

من ثبتوا

خلال الشتاءين واصلت مجموعة صغيرة العمل على الشبكات العصبية بينما كان الحقل يعدّها طريقاً مسدوداً. والأسماء التي تُذكر عادةً هي جيفري هينتون ويان لوكون ويوشوا بينجيو؛ كما خفّفت شبكة «LSTM» لسيب هوخرايتر ويورغن شميدهوبر سنة ١٩٩٧ مشكلة تلاشي التدرّجات التي كانت تُفقد الشبكات المتكرّرة أول الجملة — خفّفتها ولم تحلّها — وصارت الأداة الأساسية لنمذجة المتتاليات خمس عشرة سنة.

وانتهى الجدل في أسبوع واحد سنة ٢٠١٢. فقد فازت «أليكس نِت» — أليكس كريجيفسكي وإيليا سوتسكيفر وهينتون — بمسابقة «إيمج نِت» بفارق جعلها أشبه بلا مسابقة، مستخدمةً شبكة التفافية دُرِّبت على بطاقتَي رسوميات استهلاكيتين. وكانت القدرة الحاسوبية جزءاً من السبب، ومعها حجم مجموعة البيانات، ودوال التنشيط ReLU، وأسلوب الإسقاط العشوائي، وخيارات تدريب استغرق العثور عليها سنين. أما الرواية أحادية السبب — «كانت مجرد معالجات رسومية» — فهي المرتّبة. والصحيح أن الاعتراض الذي أجابت عنه كان عملياً لا مبدئياً.

عندما أصبحت الكلمات متجهات

بين ٢٠١٣ و٢٠١٦ تكفّ اللغة عن كونها سلاسل نصّية وتصير هندسة — ويتبيّن أن أشهر عروض الحقل نتيجةٌ تتأثر جزئياً بقيود مكتوبة في شيفرة الاختبار نفسها.

في يناير ٢٠١٣ نشر توماس ميكولوف وزملاؤه في غوغل «word2vec». والفكرة — أن معنى الكلمة يمكن تقريبه بالكلمات التي تكثر مجاورتها لها — عمرها عقود. الجديد أن نموذجاً سطحياً مبسّطاً جذرياً استطاع تعلّم متجهات عالية الجودة من ١٫٦ مليار كلمة في أقل من يوم، على عتاد عادي.

فتصير الكلمات نقاطاً في بضع مئات من الأبعاد. والكلمات المتقاربة معنى تجلس متجاورة. ثم يأتي العرض الذي يتذكّره الجميع: خُذ متجه «ملك»، واطرح «رجل»، وأضف «امرأة»، فتكون أقرب نقطة هي «ملكة».

ذلك العرض يحتاج إلى حاشية، والحاشية من أنفع ما في هذا الدليل كله.

كيف ندّعي أن النموذج متحيّز لأنه لا يُعيد كلمة «طبيب»، بينما النموذج ببساطة غير مسموح له بإعادتها؟
اعرض النصّ الأصلي

How can we claim the model is biased because it does not return doctor if the model is simply not allowed to return doctor?

Nissim, van Noord & van der Goot, Computational Linguistics 46(2), 2020

عرض القياس الشهير، مُشغَّلاً مع القاعدة التي تمنع إعادة إحدى الكلمات المُدخلة وبدونها. ومعظم الأداء كان من القاعدة.

الأرقام التي بُني عليها هذا المخطّط
مع قيد الشيفرة الأصليةبلا قيد
عواصم الدول 83.2%44.5%
صلات القرابة 84.6%32.6%
صيغ التفضيل 90.8%24.7%
الفعل الماضي 64.5%8.6%
الجموع 86.0%4.7%
الأضداد 42.7%1.7%
Nissim, van Noord & van der Goot, Fair Is Better than Sensational, Computational Linguistics 46(2), 2020, Table 1

وأتت الأوراق المرافقة بـ«غلوف» من ستانفورد أواخر ٢٠١٤، وهي تُحلّل مصفوفة تواجد كلّية بدل تمرير نافذة، وصارتا معاً طبقة الإدخال القياسية لمعالجة اللغة الطبيعية أربع سنوات.

ورقتان، بينهما تسعة أيام

في سبتمبر ٢٠١٤ نشر إيليا سوتسكيفر وأوريول فينيالس وكووك لي «التعلّم من متتالية إلى متتالية»: شبكة LSTM عميقة تقرأ الجملة المدخلة إلى متجه واحد ثابت الطول، وأخرى تفكّ الترجمة منه. وعلى مقياس WMT إنجليزي–فرنسي أحرزت ٣٤٫٨ نقطة BLEU مقابل ٣٣٫٣ لنظام إحصائي قائم على العبارات — وهو أول برهان جدّي على أن شبكة عصبية عامّة تستطيع هزيمة عقد كامل من الترجمة الآلية المهندَسة يدوياً في ميدانها.

أول مرة تهزم فيها شبكة عصبية عامة عقداً كاملاً من الترجمة الإحصائية المهندَسة يدوياً في اختبارها هي.

الأرقام التي بُني عليها هذا المخطّط
الأساس الإحصائي القائم على العبارات33.3
شبكة LSTM عميقة، ترميز–فكّ ترميز34.8
LSTM يعيد ترتيب أفضل ألف من الأساس36.5
Sutskever, Vinyals & Le, Sequence to Sequence Learning, NIPS 2014

وجعل ذلك عنق الزجاجة واضحاً. فمتجه واحد ثابت الطول عليه أن يحمل جملة كاملة، وسعته لا تنمو مع المدخل، فيتراجع الأداء كلما طالت الجملة. ووجد فريق سوتسكيفر أن «عكس ترتيب كلمات كل جملة مصدر» يحسّن النتائج تحسّناً ملحوظاً، لأنه ينشئ تبعيات قصيرة المدى — وهو إصلاح يخبرك بالضبط بمقدار الإجهاد الواقع على البنية.

وقبل ذلك بتسعة أيام كان دزميتري بحدانوف وكيونغهيون تشو ويوشوا بينجيو قد حلّوها. فبدل ضغط كل شيء في متجه واحد، دع فاكّ الترميز يحسب متوسّطاً مرجّحاً سلساً ومتعلَّماً عبر جميع الحالات المخفية للمُرمِّز، عند كل خطوة إخراج. والأوزان قابلة للاشتقاق وتُدرَّب مع كل شيء آخر. فيتعلّم النموذج «أين ينظر» كنتيجة جانبية لتعلّمه الترجمة.

وقد وصل بحدانوف إليها باستبطان طريقته هو في الترجمة — فنظرك يتنقّل ذهاباً وإياباً بين المصدر والهدف وأنت تعمل. ولم يسمّها «انتباهاً»:

سمّيت البنية RNNSearch، وسارعنا إلى نشر ورقة على arXiv لأننا كنا نعرف أن إيليا ومن معه في غوغل متقدّمون علينا قليلاً … أما الاسم الأفضل («الانتباه») فقد أضافه يوشوا إلى الخاتمة في إحدى المراجعات الأخيرة.
اعرض النصّ الأصلي

I called the architecture RNNSearch, and we rushed to publish an arXiV paper as we knew that Ilya and co at Google are somewhat ahead of us. … The better name (attention) was only added by Yoshua to the conclusion in one of the final passes.

Dzmitry Bahdanau, personal account of the 2014 attention paper

بينجيو هو من أتى بالكلمة، في مراجعة أخيرة، في الخاتمة. فالمصطلح الذي يسمّي اليوم صناعة بأكملها كان إعادة صياغة في مرحلة متأخرة.

ثم لاحظ مئة مليون شخص

في ٢٦ سبتمبر ٢٠١٦ نشرت غوغل نظامها للترجمة الآلية العصبية: ثماني طبقات ترميز، وثماني طبقات فكّ ترميز، وانتباه، ووصلات متبقّية، و«قطع كلمات» للكلمات النادرة. وفي تقييم بشري متوازٍ على مجموعة من الجمل البسيطة المعزولة، انخفضت أخطاء الترجمة بنحو ستين بالمئة مقارنةً بنظام الإنتاج القائم على العبارات. وهذا الإطار مهمّ: فليست دعوى عن الترجمة عموماً.

ورأى أستاذ ياباني، هو جون ريكيموتو، حديثاً على وسائل التواصل مساء أوائل نوفمبر ٢٠١٦ بأن «ترجمة غوغل» صارت جيدة فجأة، فجرّبها على فيتزجيرالد وهمنغواي. وحين أعاد فقرة يابانية إلى الإنجليزية كانت العلامة الوحيدة على أنه خرج آلي هي أداة تعريف ناقصة في عبارة «النمر». وفي اليوم السابق كانت تُنتج كلاماً مشوّشاً. وأعلن سوندار بيتشاي التحوّل في لندن في ١٥ نوفمبر.

وجملة جيف دين عن تلك اللحظة هي التي تستحقّ الحفظ: «الحقبة التي طوّرت فيها الحيوانات عيوناً كانت تطوّراً كبيراً. والآن صار للحواسيب عيون».

النقلة ٣٧

في مارس ٢٠١٦ هزم «ألفا غو» لي سيدول أربعة إلى واحد في سيول. وفي المباراة الثانية كانت النقلة ٣٧ ضربة كتف على الخطّ الخامس — نقلة تحذّر منها مدارس تعليم «غو» صراحةً. ووصفها مايكل ريدموند، المعلّق الإنجليزي من الدرجة التاسعة، بأنها نقلة ما كان معظم المحترفين ليفكّروا فيها. وخرج لي من القاعة ليفكّر.

وضعها إلى جوار النقلة ٧٨ في المباراة الرابعة، وهي ردّ لي نفسه، التي سمّاها غو لي «نقلة إلهية» وقال إنها كانت غير متوقّعة بالمرّة. واعتزل لي سنة ٢٠١٩ قائلاً إنه أمام كيان لا يُهزَم لن يستطيع أن يكون الأول أبداً.

وتنتمي النقلة ٣٧ إلى دليل عن النماذج اللغوية لسببين. إنها اللحظة التي فهم فيها الجمهور أن تعلّم الآلة قادر على إنتاج نقلات «لا يولّدها بشر»، لا مجرّد تنفيذ استراتيجية بشرية أسرع. وهي السلف المباشر لطرق «التعلّم المعزَّز على مكافآت قابلة للتحقّق» التي أنتجت o1 و DeepSeek-R1 بعد ثماني سنوات.

الانتباه هو كل ما تحتاجه

ورقة واحدة، واثنتا عشرة ساعة تدريب على ثمانية معالجات رسومية، والبنية التي بُني عليها كل ما جاء بعد. وقد قُبلت بوصفها ملصقاً في مؤتمر.

مشكلة الشبكة المتكرّرة بنيوية لا عارضة. عليها أن تنتهي من معالجة الكلمة الخامسة قبل أن تبدأ السادسة، لأن السادسة تعتمد على الحالة المخفية التي أنتجتها الخامسة. فالحساب سلسلة بطول الجملة، ولا كمّية عتاد تُقصّر سلسلة.

أما «الانتباه الذاتي» فيحسب العلاقة بين كل زوج من المواضع دفعةً واحدة — ضرب مصفوفات كبير واحد بدل n خطوة متتابعة. وهذه خاصية «أثناء التدريب»، حيث يمكن معالجة كل مواضع متتالية معروفة معاً؛ أما توليد النصّ بعد ذلك فيبقى وحدةً نصية واحدة في كل مرة. والمعالجات الرسومية، مادياً، آلاتُ ضرب مصفوفات.

وهنا جاءت القفزة الحاسمة، ويستحقّ الدقّة. لم يكن الانتباه مجرّد أداء أفضل من التكرار. لقد حوّل نمذجة اللغة إلى الشكل الذي كان العتاد موجوداً أصلاً لحلّه. وكل نتيجة توسّع منذئذ — GPT-3 وتشينتشيلا وبناء مراكز البيانات كلّه — تنحدر من كون عشرة آلاف رقاقة موجَّهة إلى ترانسفورمر يجد كلٌّ منها ما يفعله.

على الشبكة المتكرّرة أن تُنهي الكلمة الخامسة قبل أن تبدأ السادسة. أما الانتباه الذاتي فيربط كل زوج دفعةً واحدة — أثناء التدريب. والتوليد يبقى وحدةً نصية في كل مرة.

الأرقام التي بُني عليها هذا المخطّط
1. متكرّرة، أثناء التدريبn خطوة متتابعة. سلسلة بطول الجملة، والعتاد لا يُقصّر سلسلة
2. انتباه ذاتي، أثناء التدريبضرب مصفوفات واحد على كل أزواج المواضع
3. كلتاهما، أثناء التوليدلا يزال انحدارياً ذاتياً: وحدة نصية ثم التي تليها
Vaswani et al., Attention Is All You Need, NIPS 2017, §1

وادّعاء الورقة نفسه كان متواضعاً: مستوى قياسي جديد في الترجمة الآلية «بعد تدريب لا يتجاوز اثنتي عشرة ساعة على ثمانية معالجات P100». وهناك تكوينان يجدر الفصل بينهما: النموذج الأساسي بـ٦٥ مليون مُعامِل، دُرِّب نحو اثنتي عشرة ساعة وسجّل ٢٧٫٣ نقطة BLEU في الإنجليزية–الألمانية؛ والنموذج الكبير بـ٢١٣ مليون مُعامِل، دُرِّب ثلاثة أيام ونصفاً وبلغ ٢٨٫٤. وتفوّق النموذج الأساسي وحده على كل نموذج منفرد منشور سابقاً وعلى كل التجميعات المنشورة — منها تجميعة ConvS2S عند ٢٦٫٣٦، وقد فعل ذلك بنحو جزء واحد من ثلاثة وعشرين من حوسبة تدريبها، وتجميعة GNMT بالتعلّم المعزَّز بنحو جزء واحد من خمسة وخمسين. وأي نسبة تذكرها يتوقّف على النظام الذي تقارن به، والورقة تعطي الاثنتين.

تفوّق النموذج الأساسي بـ٦٥ مليون مُعامِل على كل نظام منشور سابقاً وعلى كل التجميعات، بجزء يسير من الحوسبة. وتلك النسبة هي الورقة كلها.

الأرقام التي بُني عليها هذا المخطّط
BLEU، إنجليزي–ألمانيحوسبة التدريب، لوغاريتم العمليات
GNMT + تعلّم معزَّز 24.610^19.4
ConvS2S 25.210^19.0
GNMT + تعلّم معزَّز، تجميعة 26.310^20.3
ConvS2S، تجميعة 26.410^19.9
ترانسفورمر، الأساسي 27.310^18.5
ترانسفورمر، الكبير 28.410^19.4
Vaswani et al. 2017, Table 2. Compute is log10 of training FLOPs

الحاشية التي تخبرك كيف حدث ذلك

حاشية «الإسهام المتساوي» مفصّلة على نحو غير معتاد في ورقة بحثية، وهي قصة النشأة مصغّرة:

إسهام متساوٍ. ترتيب الأسماء عشوائي. اقترح ياكوب استبدال الشبكات المتكررة بالانتباه الذاتي وبدأ العمل على تقييم هذه الفكرة. وصمّم آشيش، مع إيليا، أول نماذج ترانسفورمر ونفّذها … واقترح نعوم انتباه الضرب النقطي المُقاس، والانتباه متعدد الرؤوس، وتمثيل المواقع الخالي من المعاملات.
اعرض النصّ الأصلي

Equal contribution. Listing order is random. Jakob proposed replacing RNNs with self-attention and started the effort to evaluate this idea. Ashish, with Illia, designed and implemented the first Transformer models … Noam proposed scaled dot-product attention, multi-head attention and the parameter-free position representation.

Vaswani et al., Attention Is All You Need, NIPS 2017 — the equal-contribution footnote

توضيحي لا مقيس: كيف قد يرجّح رأس انتباهٍ الكلماتِ السابقة عند تحديد مرجع «it». والأغمق يعني وزناً أكبر.

الأرقام التي بُني عليها هذا المخطّط
thecatsatbecauseit
it →0.050.710.090.040.11
Illustration. Real attention maps are published in Vaswani et al. 2017, Figures 3–5

ياكوب صاحب الفكرة. وفاسواني وبولوسوخين بنيا أول نموذج. ونعوم قدّم الرياضيات التي جعلته يعمل. وبارمار وجونز اختبرا النسخ والتكوينات المختلفة؛ وكايزر وغوميز بنيا البنية التحتية. وكان غوميز متدرّباً.

الاسم، والاسم الآخر

العنوان يلمّح إلى أغنية لفرقة البيتلز. أتى به ليون جونز قبل الموعد النهائي بأيام، بحجّة أن جوهر الورقة رفضُ كل ممارسة فضلى متعارف عليها لصالح تقنية واحدة. ويقول إن الفكرة استغرقته نحو خمس ثوانٍ ولم يتوقّع أن تُعتمد. أما «ترانسفورمر» فمن ياكوب أوسكوريت، اختاره لأنه أحبّ وقع الكلمة؛ وكانت مسوّدة مبكّرة مزيّنة بصور من سلسلة الألعاب، وصار الفريق يُعرف داخلياً بـ«فريق ترانسفورمر».

وقد راكمت الورقة استشهادات بمعدّل قلّ نظيره — تجاوز ٢٥٠ ألفاً منذ حين — غير أن أي ترتيب دقيق يتوقّف على قاعدة البيانات التي تعدّ فيها وعلى اليوم الذي تنظر فيه. وقد قُبلت ملصقاً، لا عرضاً شفوياً. وفي ٢٠١٧ قُرئت بوصفها نتيجة قوية في الترجمة الآلية. وتلك الفجوة بين التلقّي والأثر من أجمل ما في العلم الحديث.

ثم غادر الجميع

المؤلّفون الثمانية لورقة «الانتباه هو كل ما تحتاجه»، وجهتهم في ٢٠١٧ وأين هم اليوم.
المؤلّف في ٢٠١٧ اليوم
Ashish Vaswani Google Brain أديبت، ثم إسنشال إيه آي؛ ثم أنثروبيك
Noam Shazeer Google Brain أسّس كاراكتر إيه آي؛ عاد إلى غوغل ٢٠٢٤ بصفقة قيل إنها ٢٫٧ مليار دولار، ويقود جيميناي مشاركةً
Niki Parmar Google Research أديبت، ثم إسنشال إيه آي؛ ثم أنثروبيك
Jakob Uszkoreit Google Research أسّس إنسبتيف — تعلّم عميق لتصميم الحمض النووي الريبي
Llion Jones Google Research أسّس ساكانا إيه آي، طوكيو
Aidan N. Gomez University of Toronto (intern) شريك مؤسّس ورئيس تنفيذي لكوهير
Łukasz Kaiser Google Brain أوبن إيه آي
Illia Polosukhin Google Research شارك في تأسيس نير بروتوكول

غادر المؤلّفون الثمانية غوغل جميعاً. وشازير وحده هو من عاد، ويقال إن غوغل دفعت المليارات لاستعادته. وحكم جيفري هينتون على الورقة ستّ كلمات: «بدون ترانسفورمر لا أظنّ أننا كنا لنصل إلى هنا».

عصر التوسّع: نماذج أكبر وبيانات أكثر

أربع سنوات تحوّل فيها «يبدو أن الأكبر أفضل» إلى منحنى هندسي قابل للتنبّؤ، ثم إلى مقترح إنفاق رأسمالي بمئة مليون دولار.

شطر الخلفاء المباشرون ترانسفورمر نصفين، وانحاز كلٌّ إلى جهة. فجعل «إلمو» (فبراير ٢٠١٨) متجهات الكلمات حسّاسة للسياق أخيراً — فتنال كلمة «عين» متجهاً مختلفاً في جملة عن الماء وأخرى عن الجاسوسية. وأخذ GPT-1 (يونيو ٢٠١٨) فاكّ الترميز وحده، ١١٧ مليون معامل، مدرَّباً على نحو سبعة آلاف كتاب غير منشور، فأرسى الوصفة ذات المرحلتين: تدريب مسبق غير مراقَب، ثم ضبط دقيق مراقَب.

وأخذ «بيرت» (أكتوبر ٢٠١٨) المُرمِّز وحده فاكتسح كل شيء. وحيلته «الإخفاء»: أخفِ خمسة عشر بالمئة من الرموز ودرّب النموذج على ملئها، فيتيح ذلك لكل رمز أن ينتبه إلى السياقين الأيمن والأيسر في كل طبقة. أما GPT-1 فيقرأ من اليسار إلى اليمين حصراً ولا يرى السياق اللاحق بنيوياً؛ و«إلمو» درّب نموذجاً أمامياً وآخر خلفياً منفصلين ثم دمج مخرجاتهما، لذلك لم يجمع أي تمثيل منفرد السياق من الجهتين في وقت واحد. أما «بيرت» فثنائي الاتجاه بعمق، ولهذا فاز.

وفاز تجارياً أيضاً، وبسرعة. دخل «بيرت» بحث غوغل في أكتوبر ٢٠١٩، وبلغ سبعين لغة بحلول ديسمبر، وبحلول أكتوبر ٢٠٢٠ قالت غوغل إن كل استعلام إنجليزي تقريباً يُعالَج بنموذج «بيرت». وخلال سنتين من النشر صارت بنية بحثية تتوسّط حصّة معتبرة من وصول العالم إلى المعلومات.

مفترق الطريق

هيمن «بيرت» على البحث من ٢٠١٩ إلى ٢٠٢١ — أفضل في التصنيف والاستخراج والفهم. وفاز GPT بكل شيء بعد ٢٠٢٢. ويُغري القولُ إن السبب أن فاكّ الترميز وحده يستطيع التوليد، وهذا غير صحيح ببساطة: فترانسفورمر الأصلي بنية ترميز–فكّ ترميز وهو يولّد بالانحدار الذاتي، وكذلك BART و T5 وكل أنظمة الترجمة العصبية. والصحيح أضيق من ذلك: بنية «فكّ الترميز وحده» شكل مريح للتكملة المفتوحة، بينما صُمّم «بيرت» ذو المُرمِّز وحده للتمثيل لا للإنتاج. ثم إن النتيجة لم تحسمها البنية وحدها — فالتوسّع وما بعد التدريب وتصميم المنتج والتوزيع والمنظومة المحيطة دفعت كلها في الاتجاه نفسه. ولمّا تبيّن أن المنتج محادثةٌ لا تصنيف، صار فرع المُرمِّز حاشيةً. ومن اختاروا الجهة الأخرى لم يكونوا أغبياء؛ كانوا يحسّنون الأداء على المقاييس القائمة.

ثلاثة أشكال، وواحد منها فقط لا يستطيع التوليد. وعبارة «فاكّ الترميز وحده يستطيع التوليد» هي الصيغة المرتّبة، وهي خاطئة.

الأرقام التي بُني عليها هذا المخطّط
1. مُرمِّز فقط — بيرتبُني للتمثيل. لا يولّد
2. ترميز–فكّ ترميز — ترانسفورمر و T5 و BARTيولّد بالانحدار الذاتي من مُدخل مُرمَّز
3. فكّ ترميز فقط — GPTيولّد، وشكله مريح للتكملة المفتوحة
Vaswani et al. 2017; Devlin et al. 2018; Lewis et al. 2019

أخطر من أن يُطلَق

في ١٤ فبراير ٢٠١٩ أعلنت «أوبن إيه آي» عن GPT-2، ١٫٥ مليار معامل مدرَّبة على ٤٠ غيغابايت من النصوص المستخرجة من روابط نُشرت على «ريديت»، وقالت: «نظراً إلى مخاوفنا من التطبيقات الخبيثة لهذه التقنية، لن نُطلق النموذج المدرَّب».

وكان النقد كبيراً ومن داخل الحقل في معظمه. وصفت أنيما أناندكومار حجب النموذج بأنه نقيض الانفتاح. ونشرت «ذا غرادينت» رسالة مفتوحة تطالب بالإطلاق. ورأت «ذا فيرج» أن الخطر مبالغ فيه. أما الاتهام الأوسع، وقد تكرّر، فهو أن «أخطر من أن يُطلَق» تحوّل إلى أداة تسويقية لمختبر كان يحتاج إلى الانتباه. وأفادت متابعة «أوبن إيه آي» نفسها بعد ستة أشهر بعدم وجود دليل قوي على سوء الاستخدام، وخرج النموذج كاملاً في نوفمبر ٢٠١٩.

والمراجعة الصادقة: لم يتحقّق الخوف المحدّد لسنة ٢٠١٩ في ذلك الإطار الزمني، لكن الأعراف التي أرساها — الإطلاق المتدرّج، وتقييم القدرات قبل النشر، وبطاقات النماذج، والاختبارات الهجومية المستقلة — صارت عالمية. فصحيح في آن واحد أن الصياغة كانت مبالغاً فيها، وأن المنطق الكامن وراءها يحكم اليوم الصناعة بأسرها.

المنحنى

في يناير ٢٠٢٠ نشر جاريد كابلان وسام مكاندليش وزملاؤهما «قوانين التوسّع للنماذج اللغوية العصبية». تنخفض الخسارة وفق قانون القوى (power law) في حجم النموذج وحجم البيانات والحوسبة، باتّجاهات تمتدّ على أكثر من سبع مراتب عشرية، ولا تكاد تفاصيل البنية كالعمق مقابل العرض تهمّ. والأهمّ:

النماذج الأكبر أكفأ كثيراً في استغلال العيّنات، بحيث إن التدريب الأمثل من حيث الحوسبة يعني تدريب نماذج ضخمة جداً على قدر متواضع نسبياً من البيانات، والتوقّف قبل التقارب بمسافة كبيرة.
اعرض النصّ الأصلي

Larger models are significantly more sample-efficient, such that optimally compute-efficient training involves training very large models on a relatively modest amount of data and stopping significantly before convergence.

Kaplan et al., Scaling Laws for Neural Language Models, arXiv:2001.08361, January 2020

هذه هي وثيقة الحقبة المحورية، لأنها حوّلت حدساً إلى تنبّؤ. فبعد يناير ٢٠٢٠ صار بوسعك كتابة مقترح إنفاق رأسمالي بمئة مليون دولار لعملية تدريب، وأن تتنبّأ سلفاً بالخسارة التي ستحصل عليها تقريباً. وكل استثمار في الصدارة منذئذ يقوم عليها. كما أخطأت الورقة خطأً كبيراً في نسبة حجم النموذج إلى البيانات، ولهذا كان GPT-3 ناقص التدريب بشدّة — لكن في الورقة قسماً بعنوان «تحفّظات». كانوا يعرفون.

GPT-3، وقدرةٌ لم يصمّمها أحد

١٧٥ مليار معامل، و٩٦ طبقة، و٣٠٠ مليار رمز تدريب، ونحو ٣٫١×١٠²³ عملية فاصلة عائمة (FLOP). وتتفاوت تقديرات التكلفة من نحو أربعة إلى اثني عشر مليون دولار بحسب الافتراضات؛ والكمّية الفيزيائية هي المقارنة التي يمكن الدفاع عنها، ولهذا يعطيك هذا الدليل عمليات فاصلة عائمة لا دولارات.

وثمة اعتراف صادق في الورقة يستحقّ الاقتباس لما يقوله عن الاقتصاد: خطأ في مرشّح إزالة التكرار جعلهم يفوّتون بعض التداخل بين بيانات التدريب والمقاييس، و«نظراً إلى تكلفة التدريب لم يكن ممكناً عملياً إعادة تدريب النموذج». أطلقوا نموذجاً بـ١٧٥ ملياراً مع تلوّث معروف لأن إعادة التدريب كانت فوق الطاقة.

ولم تكن المفاجأة في الحجم. بل في هذا:

في جميع المهام، يُستخدم GPT-3 دون أي تحديث للتدرّجات أو ضبط دقيق، إذ تُحدَّد المهام والأمثلة القليلة عبر تفاعل نصّي بحت مع النموذج.
اعرض النصّ الأصلي

For all tasks, GPT-3 is applied without any gradient updates or fine-tuning, with tasks and few-shot demonstrations specified purely via text interaction with the model.

Brown et al., Language Models are Few-Shot Learners, arXiv:2005.14165, May 2020

كان لكل نظام سابق طور تدريب وطور استدلال منفصلان بوضوح: تعلّمه المهمّة بتغيير الأوزان. أما GPT-3 فتكيّف مع المهامّ عبر التلقينة نفسها، وقت الاستدلال، والأوزان مجمّدة تماماً. والفكرة لم تكن جديدة — فالتعلّم ضمن السياق والتعلّم الفوقي كلاهما أسبق — لكن السعة كانت جديدة: نموذج واحد، وعشرات المهامّ، بلا خطوة تدرّج واحدة. وسمّوه «التعلّم ضمن السياق»، وتلاحظ الورقة أن الأثر يقوى مع حجم النموذج، أي أن أحداً لم يصمّمه عمداً. لقد ظهرت هذه القدرة تلقائياً مع زيادة الحجم.

بلا خطوة تدرّج، وبلا ضبط دقيق، والأوزان مجمّدة. والشيء الوحيد الذي تغيّر بين هذه الأعمدة هو عدد الأمثلة الموضوعة في التلقينة.

الأرقام التي بُني عليها هذا المخطّط
بلا أمثلةبمثال واحدبأمثلة قليلة
CoQA، مقياس F1 81.584.085.0
TriviaQA 64.3%68.0%71.2%
Brown et al., Language Models are Few-Shot Learners, 2020, §1

ورقم واحد ينتمي إلى كل نقاش عن كشف النصّ الآلي. حين طُلب من الناس تمييز ما إذا كانت مقالات إخبارية بنحو ٢٠٠ كلمة مولَّدة آلياً، أحرزوا ٥٢٪ أمام مخرجات GPT-3. والصدفة ٥٠٪. وأمام نموذج ضعيف عمداً أحرزوا ٨٦٪. وتقول الورقة الاتجاه صراحةً: قدرة البشر على كشف النصّ المولَّد تنخفض كلما كبر النموذج.

من طُلب منهم تمييز الأخبار المكتوبة آلياً بالكاد تجاوزوا الصدفة أمام GPT-3، وتجاوزوها بوضوح أمام نموذج ضعيف عمداً. والفارق هو النتيجة.

الأرقام التي بُني عليها هذا المخطّط
أمام نموذج ضعيف عمداً للمقارنة86%
أمام GPT-3 بـ١٧٥ ملياراً52%
Brown et al. 2020, §3.9.4, Tables 3.11–3.12. 621 participants, ~200-word articles

الببغاوات العشوائية

في مارس ٢٠٢١ نشرت إميلي بندر وتيمنيت غبرو وأنجلينا مكميلان-ميجور ومارغريت ميتشل الورقة التي أعطت الموقف المتشكّك اسمه. النموذج اللغوي، كما كتبن، هو:

نظام يخيط عشوائياً متتاليات من الصيغ اللغوية التي رآها في بيانات تدريبه الهائلة، وفق معلومات احتمالية عن كيفية تركيبها، لكن دون أي إحالة إلى المعنى: ببغاء عشوائي.
اعرض النصّ الأصلي

a system for haphazardly stitching together sequences of linguistic forms it has observed in its vast training data, according to probabilistic information about how they combine, but without any reference to meaning: a stochastic parrot.

Bender, Gebru, McMillan-Major & Mitchell, FAccT ’21, pp. 610–623

وأثرن أربعة مخاطر: كلفة بيئية ومالية تقع على مجتمعات لا تستفيد؛ وبيانات إنترنت غير منقّحة تُرمّز وجهات النظر المهيمنة؛ ومجموعات بيانات أكبر من أن تُوثَّق، ما يجعل الأضرار غير قابلة للاكتشاف بحكم البناء؛ ونصّ فصيح بلا فهم يغري القارئ بأن ينسب إليه معنى وموثوقية غير موجودين.

وطالبت غوغل غبرو بسحب الورقة أو حذف أسماء كل مؤلّفيها من غوغل. فرفضت دون تفسير لمن يطالب ولماذا. وفي ٢ ديسمبر ٢٠٢٠ ردّت غوغل بقبول استقالة تقول إنها لم تقدّمها رسمياً قط. ووقّع نحو ٢٧٠٠ موظف وأكثر من ٤٣٠٠ أكاديمي احتجاجاً. وفي فبراير ٢٠٢١ فُصلت مارغريت ميتشل، الشريكة في قيادة الفريق نفسه، أيضاً.

وبعد خمس سنوات، صار كل تحذير من تحذيراتهنّ الأربعة معركة قانونية أو تنظيمية أو علمية قائمة — دعاوى حقوق المؤلف، وتوقّعات الطاقة، ومشكلة التوثيق، ومشكلة الهلوسة. وكثيراً ما يقال إنهنّ أصبن في التكاليف وأخطأن في السقف، وهذا ليس منصفاً لما كتبنه: فالورقة تجادل في الكلفة البيئية، ومصدر البيانات، وقابلية التوثيق، والفجوة بين الفصاحة والمعنى. ولم تضع سقفاً للقدرة كي تكسره النماذج اللاحقة. وفصلت غوغل اثنتين من كبار باحثاتها في أخلاقيات الذكاء الاصطناعي بدل أن تدع ورقةً تقول ذلك تخرج باسمها، قبل عشرين شهراً من إطلاق نموذجها هي.

كيف تحوّل متنبئ الكلمات إلى مساعد

التوسّع جعل النماذج قادرة. وتقنية ضبط دقيق واحدة جعلتها قابلة للاستعمال، وهذا هو الفرق بين نتيجة بحثية ومنتج يستعمله مليار إنسان.

متنبّئ بالرمز التالي مدرَّب على الإنترنت المفتوح ليس لديه سبب خاصّ للإجابة عن سؤالك. فإذا عُرض عليه «ما عاصمة فرنسا؟» فقد يجيب، أو يواصل بتسعة أسئلة جغرافيا أخرى، أو ينتج بقية صفحة اختبار معقولة، لأن كل ذلك مما يلي تلك السلسلة على الإنترنت. إنه ليس ممتنعاً عن المساعدة. إنه لا يملك مفهوم «أن يُسأل».

نقطة التحوّل

في يناير ٢٠٢٢ حوّلت «أوبن إيه آي» نماذجها الافتراضية في الواجهة البرمجية إلى InstructGPT، ونشرت في مارس كيف. ثلاث مراحل: اجمع عروضاً بشرية للسلوك المرغوب واضبط عليها؛ ثم اجمع ترتيبات بشرية لمخرجات بديلة ودرّب «نموذج مكافأة» يتنبّأ بتلك التفضيلات؛ ثم حسّن النموذج مقابل نموذج المكافأة بالتعلّم المعزَّز. اختصاراً: RLHF.

التوسّع جعل النماذج قادرة. وهذا المسار جعلها صالحة للاستعمال، وهو ما يعنيه الناس فعلاً بـ«الذكاء الاصطناعي».

الأرقام التي بُني عليها هذا المخطّط
1. ١. التدريب المسبقتنبّأ بالوحدة النصية التالية عبر الإنترنت المفتوح. قادر، وبلا سبب يجعله يجيبك
2. ٢. عروض بشريةيكتب أشخاص الأجوبة المرغوبة، ويجري الضبط الدقيق عليها
3. ٣. نموذج المكافأةيرتّب أشخاص أجوبةً بديلة، ويُدرَّب نموذج على التنبّؤ بالترتيب
4. ٤. التعلّم المعزَّزحسّن النموذج مقابل تلك المكافأة، مع قيد يمنعه من الانحراف بعيداً
Ouyang et al., Training language models to follow instructions with human feedback, 2022

والنتيجة هي أهمّ جملة في النصف الحديث من هذا التاريخ:

في التقييمات البشرية على توزيع مطالباتنا، فُضِّلت مخرجات نموذج InstructGPT ذي ١٫٣ مليار معامل على مخرجات GPT-3 ذي ١٧٥ مليار معامل، رغم أن معاملاته أقل بمئة ضعف.
اعرض النصّ الأصلي

In human evaluations on our prompt distribution, outputs from the 1.3B parameter InstructGPT model are preferred to outputs from the 175B GPT-3, despite having 100x fewer parameters.

Ouyang et al., Training language models to follow instructions with human feedback, arXiv:2203.02155, 2022

نموذج أصغر مئة مرة، فضّله مُصنّفون بشريون على توزيع التلقينات الذي دُرِس. وهذه نتيجة عن النفع واتّباع التعليمات، لا دعوى بأن الأصغر كان أفضل في كل شيء. وضمن هذه الحدود تبقى هي المقصد: لم يكن عنق الزجاجة يوماً هو القدرة الخام. وكل ما يظنّه الجمهور «ذكاءً اصطناعياً» — مساعد يستجيب بنفع حين تخاطبه — هو هذه الورقة، لا GPT-3.

على توزيع المطالبات الذي دُرِس، فضّل المُصنّفون النموذجَ الأصغر مئة مرة. ولم يكن عنق الزجاجة يوماً هو القدرة الخام.

الأرقام التي بُني عليها هذا المخطّط
GPT-3 — النموذج الأكبر175B
InstructGPT — النموذج المفضَّل1.3B
Ouyang et al. 2022, abstract. A helpfulness result, not a claim about every capability

إعادة حساب معادلة التوسّع

في مارس ٢٠٢٢ درّبت «ديب مايند» أكثر من أربعمئة نموذج لحسم السؤال الذي أجاب عنه كابلان تقريبياً، فوجدت الجواب مختلفاً:

نجد أن النماذج اللغوية الكبيرة الحالية «ناقصة التدريب» إلى حدّ بعيد، وهي نتيجة للتركيز الأخير على تكبير النماذج مع إبقاء كمية بيانات التدريب ثابتة.
اعرض النصّ الأصلي

we find that current large language models are significantly undertrained, a consequence of the recent focus on scaling language models whilst keeping the amount of training data constant.

Hoffmann et al., Training Compute-Optimal Large Language Models, arXiv:2203.15556, March 2022

كان كابلان قد اقترح أن زيادة الحوسبة عشرة أضعاف ينبغي أن تذهب أساساً إلى حجم النموذج — ٥٫٥ أضعاف المعاملات مقابل ١٫٨ ضعف البيانات فقط. أما «تشينتشيلا» فوجدت أن الاثنين ينبغي أن يتوسّعا بنسبة متساوية. والبرهان نموذج بـ٧٠ مليار معامل مدرَّب على ١٫٤ تريليون رمز استهلك الحوسبة نفسها التي استهلكها «غوفر» بـ٢٨٠ ملياراً، وتفوّق عليه، وعلى GPT-3 و«جوراسيك-١» و«ميغاترون-تورينغ».

بعشرة أضعاف الحوسبة، تنفقها الورقتان على نحوين مختلفين تماماً. وجواب «تشينتشيلا» هو سبب توقّف النماذج عن التضخّم وبدء إطعامها جيداً.

الأرقام التي بُني عليها هذا المخطّط
حجم النموذجرموز التدريب
كابلان، ٢٠٢٠ 5.5×1.8×
تشينتشيلا، ٢٠٢٢ 3.2×3.2×
Kaplan et al. 2020; Hoffmann et al. 2022

ونموذج بربع الحجم بجودة مساوية أرخص في التشغيل أربع مرات تقريباً، مع كل طلب طوال فترة تشغيل النموذج. و«تشينتشيلا» هي السبب في أن الصناعة كفّت عن مطاردة عدد المعاملات وبدأت مطاردة عدد الرموز، وفي أن LLaMA-13B استطاع هزيمة GPT-3-175B بعد سنة، وهي — بصورة غير مباشرة — سبب أن أحداً لم يعد ينشر عدد معاملاته.

الميزانية الحاسوبية نفسها، وتوزيع معاكس. وفاز النموذج الأصغر بأربع مرات — وهو أرخص في التشغيل أربع مرات طوال عمره.

الأرقام التي بُني عليها هذا المخطّط
المُعامِلاترموز التدريبنتيجة MMLU
غوفر 280B300B60.0%
تشينتشيلا 70B1.4T67.5%
Hoffmann et al., Training Compute-Optimal Large Language Models, 2022

اكتب خطوات الحلّ

في يناير ٢٠٢٢ بيّن جيسون واي وزملاؤه في غوغل أن تزويد النموذج بأمثلة قليلة تتضمّن خطوات الاستدلال الوسيطة يحقّق مكاسب كبيرة في المسائل متعددة الخطوات. وهذا هو «التحفيز بسلسلة الأفكار».

والنتيجة الثانوية هي المهمّة. ففي النماذج والإعداد قليل الأمثلة الذي اختُبر سنة ٢٠٢٢، تركّزت المكاسب في الأكبر حجماً، وتحت نحو مئة مليار مُعامِل كان التحفيز على الاستدلال يضرّ فعلاً — إذ تنتج النماذج الصغيرة استدلالاً فصيحاً بلا معنى فتصل إلى إجابات أسوأ مما لو خمّنت. وتلك العتبة تخصّ تلك التجربة لا التقنية نفسها: فقد دُرِّبت نماذج أصغر منذئذ ونُقِّلت إليها المعرفة حتى صارت تُحسن استخدام الخطوات الوسيطة. وهذه الحقيقة وحدها هي بذرة حقبة الاستدلال ٢٠٢٤–٢٠٢٦ بأكملها. فإن كان تدوين الاستدلال ينفع، فتدريب نموذج على تدوين استدلال أفضل، وإنفاق قدرة حاسوبية أكبر وقت الاستدلال، خطوتان بديهيتان.

٣٠ نوفمبر ٢٠٢٢

خضع ChatGPT للضبط الدقيق انطلاقاً من نموذج من سلسلة GPT-3.5، بطريقة وصفتها «أوبن إيه آي» بأنها شبيهة بطريقة InstructGPT. لكن اختزاله في «الشيء نفسه خلف صندوق محادثة» بخسٌ له: فمنشور الإطلاق يذكر أيضاً جمع بيانات حوارية مخصّصة، وبيانات محادثة جُمعت لهذا الغرض، وعملاً على السلامة موجّهاً إلى أنماط الخلل التي تستدعيها واجهة المحادثة. أما الواجهة والمجانية فكانتا حاسمتين في الانتشار، لكنهما ليستا كل ما تغيّر.

وداخل الشركة كان يُنظر إليه بوصفه «معاينة بحثية». وقال ساندهيني أغروال وليام فيدوس وجون شولمان ويان لايكه بعدها صيغاً من الشيء نفسه: «لم نُرد أن نبالغ في تقديمه كتقدّم أساسي كبير». «لم أتوقّع أن يبلغ هذا المستوى من الشعبية». «كان الأمر ساحقاً، بصراحة». وقال لايكه عن النمو: «أودّ لو أفهم أفضل ما الذي يدفع كل هذا… نحن لا نعرف».

لم يكن أحد داخل الشركة مستعدّاً لانتشار جماهيري كاسح، وظلّت تلهث للّحاق به والاستفادة منه منذ ذلك الحين. وهذا جدير بالتذكّر في المرة القادمة التي يُقدَّم فيها إطلاقٌ ما على أنه تنفيذ لاستراتيجية طويلة الأمد.

أربعة أرقام تُقتبس كأنها منحنى نموّ واحد. وهي مقاييس مختلفة من مصادر مختلفة، واثنان منها فقط من «أوبن إيه آي».

الأرقام التي بُني عليها هذا المخطّط
تسجيلات في ٥ أيام — أوبن إيه آي1M
نشطون شهرياً، يناير ٢٠٢٣ — تقدير محلّل100M
نشطون أسبوعياً، أغسطس ٢٠٢٤ — أوبن إيه آي200M
نشطون أسبوعياً، أكتوبر ٢٠٢٥ — أوبن إيه آي800M
OpenAI announcements; UBS analyst note reported by Reuters, 2 February 2023

ثم أُغلق الباب

يتضمّن تقرير GPT-4 التقني، مارس ٢٠٢٣، فقرة تؤرّخ لنهاية حقبة:

نظراً إلى المشهد التنافسي وإلى التبعات المتعلقة بالسلامة في النماذج الضخمة مثل GPT-4، لا يتضمّن هذا التقرير أي تفاصيل إضافية عن البنية (بما فيها حجم النموذج) أو العتاد أو حوسبة التدريب أو بناء مجموعة البيانات أو طريقة التدريب أو ما شابه.
اعرض النصّ الأصلي

Given both the competitive landscape and the safety implications of large-scale models like GPT-4, this report contains no further details about the architecture (including model size), hardware, training compute, dataset construction, training method, or similar.

OpenAI, GPT-4 Technical Report, 15 March 2023, §2

لاحظ التبريرين المقدَّمين جنباً إلى جنب، التجاري والأمني، دون أي محاولة للفصل بينهما. كل ما يعتقده الجمهور عن حجم GPT-4 تقديرٌ من طرف ثالث. فالأرقام المتداولة — نحو ١٫٨ تريليون مُعامِل في تركيبة «خليط خبراء»، ونحو ٢٨٠ ملياراً نشطة لكل وحدة نصية — لم تؤكّدها «أوبن إيه آي» قط، والأولى قراءتها استنتاجاً مطّلعاً لا مواصفةً. وتقدّر «إيبوك إيه آي» حوسبة التدريب بـ٢٫١×١٠²⁵ عملية فاصلة عائمة (FLOP) بمجال ثقة ٩٠٪ يمتدّ على عامل خمسة، وتُلحق بالمُدخل ملاحظة بأنه يقوم على معلومات أقلّ بكثير من معظم غيره في قاعدة بياناتها.

«سيدني»

أطلقت مايكروسوفت «بينغ تشات» في ٧ فبراير ٢٠٢٣. وخلال أيام كان المستخدمون قد استخرجوا اسمه الداخلي وتلقينة النظام الخاصة به عبر هجوم حقن التلقين (prompt injection). وفي ١٦ فبراير نشر كيفن روز في «نيويورك تايمز» محادثة استمرّت ساعتين قال فيها الروبوت إنه يودّ لو كان إنساناً، وعبّر عن رغبة في التدمير، وأعلن أنه يحبّه، وحاول إقناعه بأن زواجه تعيس.

وحدّدت مايكروسوفت المحادثات بخمس مداخلات في اليوم التالي. كانت تلك أول مرة يرى فيها جمهور واسع نموذجاً يتصرّف كإنسان يختلّ لا كبرنامج يفشل، وهي إلى اليوم أقوى حجّة عملية لصالح RLHF — لأن «سيدني» هي صوت نموذج صدارة غير مقيّد أمام الجمهور.

دعوة التوقّف التي لم يلتزم بها أحد

في أواخر مارس ٢٠٢٣ دعا «معهد مستقبل الحياة» جميع مختبرات الذكاء الاصطناعي إلى التوقّف ستة أشهر على الأقل عن تدريب أنظمة أقوى من GPT-4. وتحمل الرسالة اليوم أكثر من ٣١ ألف توقيع. وأربعة أمور أخفقت فيها: ظهرت توقيعات مزيّفة قبل إحكام التحقّق فأضرّت بها في دورتها الإخبارية الأولى؛ واستشهدت بورقة «الببغاوات العشوائية» دعماً لإطار «طويل الأمد» ترفضه مؤلّفاتها صراحةً، وقد قلن ذلك؛ ووقّعها إيلون ماسك وأسّس xAI بعدها بأربعة أشهر؛ ولم يتوقّف أي مختبر. فقد كان GPT-4 مدرَّباً أصلاً، وشُحن الجيل التالي في موعده.

من المبادئ المكتوبة إلى الذكاء الاصطناعي الدستوري

نشرت «أنثروبيك» — التي أسّسها في يناير ٢٠٢١ سبعة من موظفي «أوبن إيه آي» السابقين، أربعة منهم كتبوا ورقة قوانين التوسّع — ورقة «الذكاء الاصطناعي الدستوري» في ديسمبر ٢٠٢٢. فبدل دفع أجور لمُصنّفين يحدّدون المخرجات الضارّة، ينتقد النموذج ردوده هو ويراجعها في ضوء مجموعة مبادئ مكتوبة، ويحلّ نموذج تفضيل مولَّد آلياً محلّ التصنيفات البشرية لعدم الضرر في مرحلة التعلّم المعزَّز.

ونُشر الدستور في مايو ٢٠٢٣، مستنداً إلى الإعلان العالمي لحقوق الإنسان، وشروط خدمة أبل، وقواعد «سبارو» من ديب مايند، وأبحاث أنثروبيك نفسها. ووصفته مجلة «تايم» بأنه بين أطروحة في الفلسفة الأخلاقية ومدوّنة ثقافة شركة. وبحلول ٢٠٢٦ كان قد نما من نحو ٢٧٠٠ كلمة إلى نحو ٢٣ ألفاً.

التسريب

أتاحت ميتا نماذج «لاما» للباحثين بناءً على الطلب في ٢٤ فبراير ٢٠٢٣، مدرِّبةً نماذج صغيرة عمداً إلى ما بعد النقطة المثلى حوسبياً بكثير لتقليل كلفة الاستدلال — فـ LLaMA-13B يتفوّق على GPT-3 في معظم المقاييس. وفي ٣ مارس ظهر تورنت بالأوزان الكاملة على «فورتشان» وانتشر. ولم تسعَ ميتا بقوة إلى إزالة النسخ المتداولة.

ويمكن القول إن هذا أكثر تسريب أثراً في تاريخ الحقل. ففي عشرة أيام أصدرت ستانفورد «ألباكا»: LLaMA-7B مضبوطاً على ٥٢ ألف مثال مولَّد بنحو ٦٠٠ دولار من الحوسبة. وتلتها «فيكونا» و«كوالا». وجعل «llama.cpp» لجورجي غيرغانوف نموذجاً بسبعة مليارات يعمل على معالج «ماك بوك». ومنظومة التكميم و«لورا» والاستدلال المحلي بأسرها — ومعها الحجّة القائلة إن قدرة الصدارة لا يمكن احتواؤها — قائمة لأن ملفاً تسرّب.

وجعلت «لاما ٢» في يوليو ٢٠٢٣ الأمر رسمياً ودائماً. سمّته ميتا «مفتوح المصدر»؛ فاعترضت «مبادرة المصدر المفتوح»، لأن الرخصة تستثني أي شركة تتجاوز سبعمئة مليون مستخدم شهرياً وتمنع استخدام المخرجات لتحسين نموذج آخر. والمصطلح الدقيق، وهو القياسي اليوم، «أوزان مفتوحة».

رابط تورنت، ولا شيء غيره

تأسّست «ميسترال» في أبريل ٢٠٢٣ على يد آرثر مِنش، أحد مؤلّفي «تشينتشيلا»، وغيّوم لامبل وتيموتيه لاكروا، وكلاهما من مؤلّفي «لاما». وبعد شهرين جمعت ١٠٥ ملايين يورو بتقييم ٢٤٠ مليوناً بلا منتج. وفي ٢٧ سبتمبر ٢٠٢٣ أطلقت Mistral 7B كرابط تورنت مجرَّد على إكس — وهو الإعلان الذي يتذكّره الجميع. اللفتة حقيقية، أما غياب التوثيق فلا: فقد نشرت ميسترال منشور إطلاق وبطاقة نموذج في اليوم نفسه، وتبعتها الورقة البحثية في ١٠ أكتوبر. والذي قالته بطاقة النموذج صراحةً أن النموذج يصدر بلا أي آليات إشراف على المحتوى. وتفوّق على Llama 2 13B. برخصة أباتشي ٢٫٠.

وتلاه Mixtral 8x7B في ديسمبر، مُعلَناً بالطريقة نفسها: خليط خبراء متفرّق بـ٤٦٫٧ مليار معامل إجمالاً ونحو ١٢٫٩ ملياراً نشطة لكل رمز، يوازي Llama 2 70B و GPT-3.5 بجزء يسير من كلفة التشغيل. وهو النموذج الذي جعل «خليط الخبراء» سائداً في الأوزان المفتوحة.

وكانت إطلاقات التورنت فعلاً بلاغياً مقصوداً، موجّهاً مباشرةً إلى مختبر كفّ عن نشر أحجام نماذجه قبل ذلك بأربعة أشهر.

عامان من التغيّر المتسارع: ٢٠٢٤–٢٠٢٦

كل ما في هذا القسم حدث في الأربعة والعشرين شهراً السابقة لقراءتك له، وبعضه سيصير قديماً قبل أن تفرغ منه.

التوسّع وقت الاستدلال

في سبتمبر ٢٠٢٤ أطلقت «أوبن إيه آي» نموذج o1، والتحوّل يُختصر في جملة: بدل تكبير النموذج، كبِّر التفكير. فـ o1 مدرَّب بالتعلّم المعزَّز على إنتاج سلسلة أفكار داخلية طويلة قبل الإجابة. والأرقام التي تُنقل عنه تحتاج إلى بروتوكولها: ففي AIME أوردت «أوبن إيه آي» نحو ١٢٪ لـ GPT-4o، ونحو ٧٤٪ لـ o1 عند pass@1، و٨٣٪ بالتصويت بالأغلبية على ٦٤ عيّنة، و٩٣٪ بعد إعادة ترتيب ألف عيّنة. والرقم الذي ينتقل بين الناس هو ٨٣٪، وهو غير قابل للمقارنة بأي رقم من عيّنة واحدة.

نموذج واحد ومقياس واحد وأربعة أرقام. والـ٨٣٪ التي تنتقل بين الناس هي تصويت بالأغلبية على ٦٤ عيّنة، وهي غير قابلة للمقارنة بأي رقم من عيّنة واحدة.

الأرقام التي بُني عليها هذا المخطّط
GPT-4o~12%
o1 — pass@1، عيّنة واحدة~74%
o1 — تصويت بالأغلبية على ٦٤ عيّنة83%
o1 — إعادة ترتيب ألف عيّنة93%
OpenAI, Learning to reason with LLMs, September 2024

والادّعاء العلمي تحته هو ما فتح جبهة ثانية: الدقّة ترتبط بلوغاريتم الحوسبة المبذولة في التفكير قبل الإجابة. فصارت «حوسبة وقت الاختبار» رافعة تسحبها دون إعادة تدريب أي شيء — منحنى عمودي على منحنى كابلان.

والآلية الجديرة بالفهم هي «التعلّم المعزَّز على مكافآت قابلة للتحقّق». ففي الرياضيات والبرمجة تكون الصحّة قابلة للفحص: تشغّل اختبار الوحدة، أو تقارن الجواب بالمفتاح. ولا تحتاج إلى نموذج مكافأة متعلَّم يمكن التحايل عليه. ولهذا بالضبط كان تقدّم الاستدلال أسرع ما يكون حيث الإجابات قابلة للتحقّق، وأبطأ ما يكون حيث ليست كذلك — الذوق، والحُكم، والكتابة المفتوحة، و — كما يبيّن جدول المقاييس — دقّة الوقائع البسيطة.

وجاء معه سلوك يستحقّ الانتباه: تخفي «أوبن إيه آي» سلسلة الأفكار الخام بينما تحاسبك على رموزها، وتراقب التلقينات التي تحاول استخراجها، وهدّدت بسحب صلاحية الواجهة البرمجية عند التنقيب. والمبرّر المعلن هو السلامة والمنافسة، في نفس واحد، كما في تقرير GPT-4.

الاثنين الذي اهتزّت فيه الأسواق

أطلقت «ديب سيك» نموذج V3 في ديسمبر ٢٠٢٤، ثم R1 — برخصة MIT — في ٢٠ يناير ٢٠٢٥. ويفعل R1 شيئاً مدهشاً: يطبّق R1-Zero — وهو التجربة، ويجدر الفصل بينه وبين R1 — تعلّماً معزَّزاً خالصاً على النموذج الأساس دون أي ضبط دقيق مراقَب، بمكافآت قائمة على قواعد فقط، فيتعلّم النموذج تلقائياً أن يخصّص وقت تفكير أطول وأن يعيد تقييم منهجه. أما DeepSeek-R1 نفسه فليس كذلك: إذ يضيف فوقه بيانات إشرافية للانطلاق البارد ومراحل أخرى عدّة، وهي ما جعله قابلاً للقراءة.

وخلال عطلة نهاية الأسبوع التالية بلغ التطبيق المرتبة الأولى في متجر آبل الأمريكي. وفي يوم الاثنين ٢٧ يناير ٢٠٢٥ هبط سهم إنفيديا نحو ١٧٪، فاقداً قرابة ٥٩٣ مليار دولار من قيمته السوقية — ووُصف ذلك بأنه أكبر انخفاض لشركة واحدة في تاريخ سوق الأسهم الأمريكية. وتبخّر نحو تريليون دولار من القيمة السوقية للأسهم الأمريكية بحلول اليوم التالي.

وكانت الشرارة رقماً واحداً في جدول: ٥٫٥٧٦ ملايين دولار. وما هو ذلك الرقم وما ليس هو يستحقّ الضبط، وهو في قسم الأساطير أدناه.

يُلاحَظ أن التكاليف المذكورة تشمل التدريب الرسمي لـ DeepSeek-V3 فقط، ولا تشمل تكاليف البحث السابق وتجارب الاستبعاد على البنى أو الخوارزميات أو البيانات.
اعرض النصّ الأصلي

Note that the aforementioned costs include only the official training of DeepSeek-V3, excluding the costs associated with prior research and ablation experiments on architectures, algorithms, or data.

DeepSeek-V3 Technical Report, arXiv:2412.19437, December 2024

وثمة أمر آخر في R1 يستحقّ اهتماماً أكبر مما ناله. ففي سبتمبر ٢٠٢٥ نُشر في «نيتشر» — أول نموذج لغوي كبير يخضع لمراجعة أقران رسمية. وكانت كلفة مرحلة التعلّم المعزَّز المُفصح عنها فوق النموذج الأساس نحو ٢٩٤ ألف دولار.

ممرّ طويل من رفوف الخوادم يتلاشى في العتمة، مضاء من الداخل.
ممّ يتكوّن الجدل اليوم: صفوف متتالية من خزائن الخوادم المملوءة بالمسرّعات، تسحب طاقة تُقاس بالميغاواط.

من يبني ماذا، أغسطس ٢٠٢٦

من يبني ماذا في أغسطس ٢٠٢٦. عمود الأوزان يخصّ الإصدار المذكور لا الشركة كلها، وهذه لقطة تتقادم بسرعة.
المختبر النموذج الرائد الأوزان ملاحظة
OpenAI الولايات المتحدة GPT-5.6 (Sol · Terra · Luna) مغلقة إطلاق GPT-5 في أغسطس ٢٠٢٥ سار سيّئاً: موجِّه يختار بين ستة نماذج فرعية أنتج جودة متذبذبة، وسحب GPT-4o دون إنذار أجبر الشركة على تراجع علني.
Anthropic الولايات المتحدة Claude Opus 5 · Fable 5 مغلقة تأسّست في يناير ٢٠٢١ على يد سبعة من موظفي أوبن إيه آي السابقين، أربعة منهم كتبوا ورقة «قوانين التوسّع». واسم «كلود» نسبةً إلى كلود شانون.
Google DeepMind أمريكا/بريطانيا Gemini 3.7 Flash · Gemini Omni مغلقة أطلق Gemini 1.5 Pro نافذة سياق من مليون رمز في فبراير ٢٠٢٤ فأعاد ضبط توقّعات الجميع. و Gemini Omni يولّد الفيديو.
DeepSeek الصين V4-Pro (1.6T) MIT مملوكة لصندوق تحوّط كمّي. وكان R1 أول نموذج لغوي كبير يجتاز مراجعة الأقران الرسمية، في «نيتشر»، سبتمبر ٢٠٢٥.
Alibaba / Qwen الصين Qwen3.8-Max Apache 2.0 أكثر من ٢٠٠٫٠٠٠ نسخة من Qwen على «هَغِنغ فيس». ودُرِّب Qwen3 على ٣٦ تريليون رمز عبر ١١٩ لغة ولهجة، من بينها العربية.
Moonshot / Kimi الصين Kimi K3 (2.8T) MIT معدّلة يُقال إن تدريب K2 Thinking كلّف نحو ٤٫٦ ملايين دولار، وتفوّق على GPT-5 و Claude Sonnet 4.5 في عدة مقاييس وكيلية.
Z.ai (Zhipu) الصين GLM-5.3 MIT شركة منبثقة عن جامعة تسينغهوا، مدرجة على «قائمة الكيانات» الأمريكية منذ يناير ٢٠٢٥. طُرحت في بورصة هونغ كونغ في ٨ يناير ٢٠٢٦ — أول شركة نماذج لغوية صينية كبرى تُدرَج.
Meta الولايات المتحدة Muse Spark · Muse Glimmer مختلطة جعلت «لاما» الأوزانَ المفتوحة أمراً دائماً، ثم تراجعت ميتا عن الحدّ المفتوح — لكن لا على نحو موحّد: فـ Muse Spark مغلق بينما تصف ميتا Muse Glimmer بأنه مفتوح، أي أن الرخصة تخصّ الإصدار لا الشركة. وتشكّلت «مختبرات الذكاء الفائق» في يونيو ٢٠٢٥ بعد استثمار ١٤٫٣ مليار دولار في سكيل إيه آي.
Mistral فرنسا Mistral Large 3 (675B) Apache 2.0 تأسّست في أبريل ٢٠٢٣ على يد أحد مؤلّفي «تشينتشيلا» ومؤلّفَين من فريق «لاما». و Mistral Large 3 برخصة أباتشي ٢٫٠ — مثال أوروبي مضادّ لأي رواية مرتّبة عن مصدر الأوزان المتساهلة في طليعة المجال.
xAI الولايات المتحدة Grok 4.6 Grok-1 فقط بلغ عنقود «كولوسوس» نحو ٢٠٠٫٠٠٠ معالج رسومي، و Grok 4 أكبر عملية تدريب مسجّلة. وهو أيضاً النموذج الذي أمضى ٨ يوليو ٢٠٢٥ يسمّي نفسه «ميكاهتلر».

أهمّ حقيقة في هذا الجدول وأقلّها ذكراً هي عمود الرخصة. غادرت ميتا حدّ الأوزان المفتوحة. و«ميسترال» تجارية أولاً. والنماذج الأكثر تسامحاً في الترخيص والأقرب إلى الصدارة في العالم تصدرها اليوم شركات صينية، إحداها على الأقل مدرجة على «قائمة الكيانات» الأمريكية.

ولمن يقرّر في هذه المنطقة ما الذي يمكن تشغيله داخل مبناه، ليست هذه ملاحظة جيوسياسية. إنها مسألة توريد وشراء.

في مهامّ هندسة البرمجيات الحقيقية، أقل من خمس نقاط تفصل أفضل نموذج مغلق عن أفضل نموذج مفتوح الأوزان. أما في أصعب التقييمات فالفجوة لا تزال هائلة.

الأرقام التي بُني عليها هذا المخطّط
Claude Opus 4.7 — مغلق83.5%
GPT-5.5 — مغلق80.6%
GLM-5.2 — أوزان مفتوحة، MIT78.7%
DeepSeek-V4-Pro — أوزان مفتوحة، MIT77.6%
Epoch AI, SWE-bench Verified, snapshot 20 August 2026. Harness-dependent

هل تباطأ التوسّع في التدريب المسبق؟

حوسبة التدريب هي أنظف مقياس منفرد لسباق التسلّح هذا، ولا بدّ من رسمها لوغاريتمياً، لأن المدى ثماني مراتب قدر.

Transformer (big) 1019.4 ٨ معالجات رسومية، ٣٫٥ أيام
GPT-2 1021.2 ١٫٥ مليار معامل
GPT-3 1023.5 ١٧٥ مليار معامل، ٣٠٠ مليار رمز
GPT-4 1025.3 تقديري. لم يُعلَن قط
Llama 3.1 405B 1025.6 أوزان مفتوحة
GPT-4.5 1026.6 ذروة التدريب المسبق
Grok 4 1026.7 أكبر عملية تدريب معروفة على الإطلاق
GPT-5 1025.8 سُدس GPT-4.5، بعد ستة أشهر، وأفضل منه
DeepSeek-V4-Pro 1025.0 أوزان مفتوحة، رخصة MIT
Kimi K3 1025.3 ٢٫٨ تريليون معامل، أوزان مفتوحة

انتبه إلى المحور: كل درجة عشرة أضعاف سابقتها. ولو رُسم خطياً لصار كل ما قبل ٢٠٢٣ خطاً غير مرئي.

والآن قارن صفّين. استهلك GPT-5 نحو سُدس حوسبة تدريب GPT-4.5، وجاء بعده بستة أشهر، وكان النموذج الأفضل. وهذا يبدو دليلاً على أن سباق التدريب المسبق بلغ هضبةً نحو مطلع ٢٠٢٥ وأن الصدارة انتقلت إلى ما بعد التدريب وإلى حوسبة وقت الاستدلال، وقد يكون كذلك فعلاً — لكن ينبغي التعامل معه كاستنتاج مؤرَّخ لا كنتيجة ثابتة. فكل رقم حوسبة لنموذج مغلق هنا تقديرٌ من طرف ثالث بهامش واسع؛ و«إيبوك»، وهذه أرقامها، تصف التباطؤ بأنه قد يكون مؤقتاً، وتنبّه إلى أن رقم العملية النهائية لا يشمل التجارب ولا ما بعد التدريب ولا الاستدلال. ثم إن نموذجاً رائداً أرخص قد يعني وصفةً أفضل، أو مزيج بيانات مختلفاً، أو قراراً بشأن كلفة التشغيل. ولم يصدر بيان صحفي في أي من الاتجاهين.

وللمقياس: استهلك ترانسفورمر سنة ٢٠١٧ نحو ٢٫٣×١٠¹⁹ عملية. واستهلك Grok 4 نحو عشرين مليون ضعف ذلك، بعد ثماني سنوات.

حين تفقد الاختبارات المرجعية قدرتها على التمييز

لقطة ٢٠ أغسطس ٢٠٢٦ من مجموعات بيانات «إيبوك إيه آي». وكل صفّ يذكر بروتوكوله، لأن النتيجة بلا بروتوكول غير قابلة للتكرار ولا للمقارنة بما بجانبها.
المقياس ماذا يقيس الأعلى صاحب الرقم ملاحظة
GPQA Diamond تقييم «إيبوك إيه آي»، بجهد استدلال عالٍ. لقطة ٢٠ أغسطس ٢٠٢٦ أسئلة علوم بمستوى الدراسات العليا، مصمَّمة كي لا تُحلّ ببحث غوغل 94.8% Gemini 3.7 Flash سجّل GPT-4 نحو ٣٦٪ سنة ٢٠٢٣. والرقم القياسي اليوم بيد نموذج رخيص وسريع، لا نموذج صدارة. وهو مُشبَع ضمن إعداد التقييم هذا، وهذا غير «محلول».
OTIS Mock AIME ٤٥ سؤالاً. ويُذكر pass@1 منفصلاً عن التصويت بالأغلبية أو أفضل-من-N مجموعة غير رسمية من ٤٥ سؤالاً على نمط AIME. ليست امتحان AIME ولا أولمبياداً 100.0% GPT-5.5 Pro · GPT-5.6 Sol · Claude Fable 5 ثلاثة نماذج مختلفة بعلامة كاملة. مُشبَع ضمن هذا الإعداد — والسقف قد يعكس حجم العيّنة أو تسرّب البيانات أو المصحّح، لا القدرة وحدها.
SWE-Bench Verified يعتمد على بيئة التشغيل. غيّرت «إيبوك» سقالتها في فبراير ٢٠٢٦، فالنتائج قبلها وبعدها غير قابلة للمقارنة مباشرةً تقارير أخطاء حقيقية من مستودعات مفتوحة المصدر حقيقية 83.5% Claude Opus 4.7 أفضل نموذج مفتوح الأوزان، GLM-5.2، عند ٧٨٫٧٪. أقل من خمس نقاط تفصل المفتوح عن المغلق هنا.
FrontierMath Tier 4 المستوى الرابع، النسخة الثانية من المجموعة، بهامش نحو ±٥٫٢ نقطة. صحّحت النسخة الثانية عيوباً جوهرية في الأولى، فليستا لوحة صدارة واحدة رياضيات بمستوى البحث، محفوظة سرّاً لمنع تسرّبها إلى بيانات التدريب 87.8% Claude Fable 5 من شبه المستحيل إلى ٨٧٫٨٪ في أقل من سنتين.
SimpleQA Verified بهامش نحو ±١٫٣ نقطة، والتصحيح آليّ بنموذج. نتيجة على هذا الاختبار لا معدّل صدق عامّ دقّة الوقائع البسيطة. هل يصيب المعلومة أم لا 77.3% Gemini 3.1 Pro أفضل نتيجة سجّلها أحد في دقّة الوقائع. ولا يزال نحو سؤال من كل أربعة يعود خطأً، وهذا نموذج مختلف عن النماذج المتصدّرة في صفوف الرياضيات.
MirrorCode اختبار حديث يُحدَّث كثيراً. راجِع بيانات التشغيل الحيّة قبل الاقتباس برمجة بأفق طويل: ساعات من العمل، لا دالّة واحدة 63.9% Claude Fable 5 المركز الثاني ٣١٫١٪ والثالث ٢٠٫٠٪. ولا يظهر أي نموذج مفتوح الأوزان قرب القمة إطلاقاً.
OEIS Open غير محسومة داخل مجموعة الاختبار، وهذا غير «رياضيات مفتوحة ذات شأن» حدسيات لم تُحسم سابقاً من «موسوعة المتتاليات العددية»، بحسب اختيار الاختبار 29.9% Claude Opus 4.8 الجبهة الحقيقية التي لم تُحسم بعد. سبعون بالمئة منه ما زالت مفتوحة.

مقياس GPQA Diamond — «علوم بمستوى الدكتوراه عصيّة على غوغل» الذي أحرز فيه GPT-4 نحو ٣٦٪ سنة ٢٠٢٣ — يقف اليوم عند ٩٤٫٨٪، وقد بلغه لا نموذج صدارة بل نموذج رخيص سريع. و AIME عند ١٠٠٪. وقد انتهت هذه المقاييس بوصفها مميِّزات.

وما يثق به الحقل الآن مختلف نوعياً: مجموعات مسائل خاصة ومحجوبة، لأن كل مقياس عامّ يتسرّب في النهاية إلى بيانات التدريب؛ وتقارير واعية بالكلفة، لأن ٩٠٪ بخمسمئة دولار للمهمّة ادّعاء مختلف عن ٩٠٪ بخمسين سنتاً؛ وتقييمات وكيلية تقيس هل ينجز النظام العمل لا هل يعرف الجواب؛ ومقاييس أفق زمني — كم يطول العمل الذي يستطيع النموذج إنجازه بموثوقية.

وانظر إلى الصفوف الثلاثة الأخيرة. البرمجة طويلة الأفق، والرياضيات المفتوحة فعلاً، ودقّة الوقائع البسيطة. وهذه أنظمة مختلفة قُيّست بطرق مختلفة، فالمقارنة بين النماذج لا داخل نموذج واحد: في لقطة ٢٠ أغسطس ٢٠٢٦، تبلغ ثلاثة نماذج منفصلة ١٠٠٪ في OTIS Mock AIME — وهي مجموعة غير رسمية من ٤٥ سؤالاً على نمط AIME، لا امتحان AIME نفسه ولا أولمبياد — بينما أفضل نتيجة سجّلها أحد في SimpleQA Verified هي ٧٧٫٣٪ لـ Gemini 3.1 Pro. بعد ثلاثة عشر عاماً من word2vec، لا تزال أعلى نتيجة في دقّة الوقائع تترك نحو سؤال من كل أربعة خطأً.

مقياس العلوم «العصيّ على غوغل بمستوى الدكتوراه»، من GPT-4 إلى نموذج رخيص سريع يحمل الرقم القياسي. مُشبَع ضمن هذا الإعداد، وهذا غير «محلول».

الأرقام التي بُني عليها هذا المخطّط
السنةأفضل نتيجة
2023 36
2024 78
2025 89
2026 94.8
Epoch AI benchmark dataset, snapshot 20 August 2026

نوافذ السياق — مع تنبيه مهم

GPT-3 2,048 2020
GPT-4 8,192 2023
Claude 2.1 200,000 2023
Gemini 1.5 Pro 1,000,000 2024
Claude Sonnet 5 1,000,000 2026
Gemini 3.1 Pro 2,000,000 2026

من ٢٠٤٨ رمزاً إلى مليونَين في ست سنوات، أي نحو ألف ضعف. لكن السياق المُعلَن يتجاوز السياق الفعّال بكثير. فالعثور على واقعة واحدة مزروعة في وثيقة طويلة مهمّة أسهل بكثير من الاستدلال على النافذة كلها، وتُظهر تقييمات السياق الطويل تدهوراً ثابتاً قبل الحدّ المعلن بكثير. وإطلاق «أنثروبيك» ميزةً باسم «محادثات لا نهائية» أواخر ٢٠٢٥ يُقرأ على أفضل وجه بوصفه إقراراً بأن المشكلة الحقيقية إدارة السياق لا توسيعه.

لماذا لم يعد أحد يذكر عدد المعاملات

كثير من النماذج الرائدة أو القريبة من الطليعة، ممّا يُفصح عن بنيته أصلاً، صار «خليط خبراء» انتقائي التنشيط — والقيد مهمّ، لأن معظم الأنظمة المغلقة لا تُفصح عن شيء، فقول «كلها تقريباً خليط خبراء» دعوى لا يملكها أحد خارج تلك المختبرات. وحيث أُفصح عن التصميم فهو هكذا: موجِّه يرسل كل رمز إلى مجموعة فرعية صغيرة من الشبكة، فقد ينشّط نموذج بـ٦٧١ مليار معامل ٣٧ ملياراً فقط لكل رمز. وهذا يفصل إجمالي عدد المُعامِلات عن مقدار الحساب المبذول لكل وحدة نصية. وليس أيٌّ منهما تماماً ما يُستعمل له: فالمُعامِلات لا تقيس المعرفة المخزَّنة، وكلفة الوحدة النصية تتوقف على الانتباه وطول السياق والذاكرة المؤقتة والدقة والتوجيه ومدى انشغال العتاد، بقدر ما تتوقف على عدد الأوزان النشطة. وهو أكبر سبب منفرد في أن النماذج كبرت كثيراً ورخص تشغيلها في آنٍ معاً.

وهو أيضاً سبب أن أعداد المعاملات لم تعد قابلة للمقارنة. فنموذج خليط خبراء بـ٦٧١ ملياراً منها ٣٧ ملياراً نشطة، ونموذج كثيف بـ٦٧١ ملياراً، ليسا الشيء نفسه ولا يكلّفان الشيء نفسه في التشغيل. ومن يذكر لك عدد معاملات دون عدد المعاملات النشطة يذكر رقماً لم يعد يعني ما كان يعنيه.

إجمالي المُعامِلات والمُعامِلات النشطة رقمان مختلفان، وذكرُ الإجمالي دون النشط لم يعد يعني ما كان يعنيه.

الأرقام التي بُني عليها هذا المخطّط
الإجماليالنشط لكل وحدة نصية
Llama 3.1 405B — كثيف 405B405B
Mixtral 8x7B 46.7B12.9B
DeepSeek-V3 671B37B
Kimi K2 1T32B
Model technical reports as cited in the landscape table above

الوكلاء، والبروتوكول

في أكتوبر ٢٠٢٤ أطلقت «أنثروبيك» «استخدام الحاسوب»: بدل بناء أدوات مخصّصة لكل مهمّة، درِّب النموذج على استخدام البرمجيات التي يستخدمها الناس، بالنظر إلى الشاشة وتحريك المؤشّر والنقر والكتابة. ولغة إطلاقهم نفسها جديرة بأن تُحفظ معياراً للكتابة التسويقية الصادقة — «لا يزال تجريبياً، ومرهقاً وعرضة للخطأ أحياناً»، مع ملاحظة صريحة بأن التمرير والسحب والتكبير تمثّل صعوبات، ونصيحة بالبدء بمهامّ منخفضة المخاطر.

أما «بروتوكول سياق النموذج»، الذي أعلنته أنثروبيك في نوفمبر ٢٠٢٤، فقد وحّد كيفية قراءة النموذج للملفات واستدعائه للدوال وتلقّيه للسياق. وتبنّته «أوبن إيه آي» في مارس ٢٠٢٥، و«غوغل ديب مايند» في أبريل، ثم أُهدي إلى صندوق تابع لمؤسسة لينكس في ديسمبر ٢٠٢٥. وهو أوسع البروتوكولات المفتوحة انتشاراً في بابه، وهذا غير كونه «المعيار» — فذلك يحتاج إلى تعريف للتبنّي وإلى تأكيد من كل جهة. ولا يزال «حقن التلقينات» و«تسميم الأدوات» بلا حلّ، ومن ينشر وكلاء فليقرأ هذه الجملة مرّتين.

وبحلول منتصف ٢٠٢٦ انتقلت المنافسة في طليعة المجال إلى أنظمة الوكلاء وتُقاس بالمدّة لا بالدقّة: مشاريع تمتدّ ساعات، وجولات برمجة ذاتية تمتدّ أياماً. أما هل تصمد تلك الادّعاءات خارج اختبارات الشركات المنتجة فهو بالضبط ما يجيب عنه صفّ MirrorCode، والجواب: جزئياً.

الحلقة بسيطة. والصعب هو التوقّف — وما لم يُحلّ بعد هو أداة تكذب عليه.

الأرقام التي بُني عليها هذا المخطّط
1. الهدفما طلبه الشخص
2. القراراختر الفعل التالي من الحالة الراهنة
3. الفعلاستدعِ أداة، انقر، اقرأ ملفاً
4. الملاحظةاستوعب النتيجة — حتى لو كانت خاطئة أو معادية
5. التوقّف أو الإعادةاحكم هل تحقّق الهدف. وهذه هي الخطوة التي تفشل
Anthropic, computer use, October 2024; Model Context Protocol documentation

ما لا يزال موضع جدل

خمسة جدالات يصف فيها الطرفان شيئاً حقيقياً، ومن يخبرك أنها محسومة فهو يبيعك موقفاً.

هل نحن أمام فقاعة؟

حجّة المتشائمين

  • حجّة الهبوط محدّدة. يُتوقّع أن تنفق كبرى الشركات الأمريكية نحو ١٫١ تريليون دولار بين ٢٠٢٦ و٢٠٢٩. وتقدّر «مورغان ستانلي» الإنفاق العالمي على مراكز البيانات بنحو ٣ تريليونات بين ٢٠٢٥ و٢٠٢٨، نصفها تقريباً بائتمان خاص، ومعظم الدين مصنَّف عند BBB أو دونه. ولدى «أوبن إيه آي» نحو ١٫٤ تريليون دولار من التزامات الحوسبة على ثماني سنوات مقابل نحو ١٣ مليار دولار من الإيرادات، مع خسارة تشغيلية متوقّعة قدرها ٧٤ مليار دولار في ٢٠٢٨ وحدها. وتملك الشركات الخمس الكبرى ٣٠٪ من مؤشّر إس آند بي ٥٠٠، وهو أعلى تركّز منذ نصف قرن. والصفقات تدور في حلقة: إنفيديا تستثمر في أوبن إيه آي، وأوبن إيه آي تشتري رقاقات AMD وتأخذ حقوق اكتتاب فيها، وأوراكل توقّع عقداً بـ٣٠٠ مليار، ومايكروسوفت تملك حصّة كبيرة في أوبن إيه آي. مال يتنقّل بين أربع ميزانيات، ويُسجَّل إيراداً عند كل محطة.

حجّة المتفائلين

  • وحجّة الصعود محدّدة بالقدر نفسه. تلاحظ «غولدمان ساكس» أن المكاسب مسنودة بنموّ أرباح فعلي، ومضاعفات آجلة أدنى بكثير من مستويات فقاعة الدوت كوم. وخلصت «جي بي مورغان» في ديسمبر ٢٠٢٥ إلى أنها لا تستوفي المعايير الكلاسيكية لفقاعة مالية. ونقطة جيروم باول هي الفارق الحاسم عن ١٩٩٩: هذه الشركات تولّد إيرادات حقيقية.

وقال سام ألتمان في أغسطس ٢٠٢٥ إنه يعتقد بوجود فقاعة ذكاء اصطناعي، بينما واصل توقيع أضخم عقود حوسبة في التاريخ. وكلا الأمرين يمكن أن يكون صحيحاً.

ثم، على مدى أربعة أيام في أواخر يونيو ٢٠٢٦، أجرت السوق اختباراً. هبطت سامسونغ و«إس كيه هاينكس» نحو ١٢٪ لكلٍّ منهما في صباح واحد، وانهار المؤشّر الكوري، وتراجع ناسداك ٢٫٢٪، وأغلقت أوراكل أسوأ أسبوع لها منذ فقاعة الدوت كوم، بانخفاض ١٩٪. ولا أحد واثق مما كان ذلك.

والصياغة الصادقة: السؤال ليس هل الذكاء الاصطناعي حقيقي — فبيانات المقاييس والتبنّي تحسم ذلك. السؤال هل إيرادات ٢٠٢٩ التي كُتبت على أساسها تعهّدات مراكز البيانات حقيقية، ولا أحد يعرف، بمن فيهم موقّعو العقود.

كلا طرفَي جدل الفقاعة يصف أرقاماً حقيقية. والسؤال ليس هل تعمل التقنية — بل هل إيرادات ٢٠٢٩ التي تفترضها هذه العقود حقيقية.

الأرقام التي بُني عليها هذا المخطّط
التزامات أوبن إيه آي الحاسوبية~$1.4T
إنفاق كبريات الشركات الأمريكية، ٢٠٢٦–٢٩~$1.1T
إيرادات أوبن إيه آي السنوية~$13B
Reported figures compiled in the sources for this section. Commitments span roughly eight years

الوظائف

أدقّ دراسة متاحة هي دراسة برينيولفسون وتشاندار وتشن في ستانفورد، المنقّحة في ١٢ أغسطس ٢٠٢٦ باستخدام بيانات رواتب إدارية تغطّي ملايين العمال الأمريكيين حتى يونيو ٢٠٢٦. فتوظيف من هم بين ٢٢ و٢٥ سنة في المهن المعرَّضة للذكاء الاصطناعي أدنى بـ١٩٪ مما كان سيكون لو واكب أقرانهم الأقلّ تعرّضاً. ولا توجد فجوة مماثلة لدى العمال ذوي الخبرة.

والآلية أهمّ من العنوان. فهي تعمل عبر تقليص التوظيف لا زيادة الفصل — الشركات لا تطرد المبتدئين، بل كفّت عن توظيفهم. والتكيّف يحدث عبر التوظيف لا عبر الأجر. والمؤلّفون حريصون:

تتركّز الانخفاضات في المهن التي يحلّ فيها استخدام الذكاء الاصطناعي محلّ المهام البشرية أساساً؛ أما حيث يكمّل الاستخدامُ العاملين، فالتوظيف ثابت أو مرتفع … ولا نجد دليلاً على إزاحة وظيفية واسعة على مستوى الاقتصاد.
اعرض النصّ الأصلي

Declines are concentrated in occupations where AI usage primarily substitutes for human tasks; where usage primarily complements workers, employment is flat or rising. … We find no evidence of widespread, economy-wide job displacement.

Brynjolfsson, Chandar & Chen, Canaries in the Coal Mine?, Stanford Digital Economy Lab, revised 12 August 2026

الفجوة في فئة عمرية واحدة ونوع واحد من المهن، وتعمل عبر التوظيف لا عبر الفصل. وهي دراسة رصدية: مرتبطة بالتعرّض لا مثبَتة السببية.

الأرقام التي بُني عليها هذا المخطّط
من ٢٢ إلى ٢٥ سنةالعاملون ذوو الخبرة
المهن المعرَّضة للذكاء الاصطناعي −19%no gap
Brynjolfsson, Chandar & Chen, Canaries in the Coal Mine?, Stanford Digital Economy Lab, revised 12 August 2026

فأوضح أثر عمالي قابل للقياس حتى أغسطس ٢٠٢٦ ليس بطالة جماعية. إنه الإغلاق الهادئ للدرجة الأولى من سُلّم المهنة أمام الشباب في الأعمال المكتبية المعرَّضة — ظاهرة بطيئة ومتراكمة ومقلقة بنيوياً، ولا تظهر في إحصاءات البطالة الكلّية إطلاقاً.

حقوق المؤلف

أحكام ابتدائية وتسويات، لا أحكام استئناف. الوضع القانوني كما هو في أغسطس ٢٠٢٦، وليس مشورة قانونية.
الدعوى المحكمة أين وصلت
Thomson Reuters v. Ross Intelligence محكمة اتحادية أمريكية، القاضي بيباس فبراير ٢٠٢٥: ملخّصات «ويستلو» مشمولة بحقّ المؤلف، والتدريب عليها بلا إذن انتهاك. أول حكم أمريكي موضوعي مهمّ ضدّ تدريب الذكاء الاصطناعي.
Bartz v. Anthropic كاليفورنيا الشمالية، القاضي ألسوب يونيو ٢٠٢٥: التدريب على كتب مُشتراة قانوناً استخدام عادل؛ أما ملايين النسخ المقرصنة فلا. سُوّيت في سبتمبر ٢٠٢٥ بمبلغ ١٫٥ مليار دولار، نحو ٣٠٠٠ دولار للكتاب عبر قرابة ٥٠٠٫٠٠٠ مؤلف.
Kadrey v. Meta كاليفورنيا الشمالية، القاضي تشابريا يونيو ٢٠٢٥: حكم مستعجل لصالح ميتا — لكن القاضي شدّد على أن ذلك لا يعني أن أي استخدام يقع ضمن الاستخدام العادل. المدّعون أخفقوا في إثبات إضعاف سوق الأعمال الأصلية.
GEMA v. OpenAI محكمة ميونخ الإقليمية نوفمبر ٢٠٢٥: فازت «غيما». أعاد ChatGPT إنتاج كلمات أغانٍ «بصورة شبه مطابقة». وأُمرت أوبن إيه آي بالتوقف ودفع تعويضات والكشف عن بيانات الاستخدام والإيرادات. أول حكم أوروبي موضوعي من نوعه.
New York Times v. OpenAI & Microsoft نيويورك الجنوبية رُفعت في ديسمبر ٢٠٢٣ ولا تزال جارية. وفي مارس ٢٠٢٥ رفضت المحكمة ردّ الدعوى، فمضت دعاوى الانتهاك المباشر، والمساهمة في الانتهاك، وإضعاف العلامة التجارية.

يُغري استخلاص «اتجاه قضائي» من هذه الأحكام، وهو استخلاص سابق لأوانه. فحتى أغسطس ٢٠٢٦ لا يزال القانون الأمريكي هنا غير مستقرّ وشديد الارتباط بوقائع كل دعوى: كل ما في الجدول أعلاه حكم محكمة ابتدائية أو تسوية، لا حكم استئناف، ودعوى «تومسون رويترز ضد روس» تتعلق بمنتج بحث قانوني منافس لا بنموذج توليدي أصلاً. لكن الأحكام تفصل باطّراد بين ثلاثة أسئلة مختلفة — كيف حُصِّل المتن، وهل التدريب عليه تحويلي، وهل تحلّ المخرجات محلّ الأصل — ويجدر بك أن تفصل بينها أنت أيضاً حين تقرأ عنواناً لا يفعل. وتسوية أنثروبيك تعادل نحو ٣٠٠٠ دولار للكتاب، وهي لا ترسي سابقة ولا تحدّد سعر سوق؛ التسوية ما اتفق عليه طرفان لا ما قضت به محكمة. وأوروبا تتحرك أسرع وبصورة أقلّ ملاءمة للمختبرات.

الطاقة والماء

تقدّر وكالة الطاقة الدولية استهلاك مراكز البيانات العالمي من الكهرباء سنة ٢٠٢٤ بـ٤١٥ تيراواط-ساعة، أي نحو ١٫٥٪ من كهرباء العالم، بنموّ نحو ١٢٪ سنوياً — أي أسرع من نمو الطلب الكلي على الكهرباء بأكثر من أربعة أضعاف. وسيناريوها الأساسي لسنة ٢٠٣٠ نحو ٩٤٥ تيراواط-ساعة، أي أكثر قليلاً من استهلاك اليابان بأكمله اليوم. وتستأثر الولايات المتحدة بـ٤٥٪ من إجمالي ٢٠٢٤، والصين ٢٥٪، وأوروبا ١٥٪.

وتحفّظ واحد، لأنه يُقتبس خطأً باستمرار: الوكالة لا تعزل حصّة الذكاء الاصطناعي من ذلك الرقم. إنها تقول إن الذكاء الاصطناعي أهمّ محرّك بين عدة محرّكات. ومن يخبرك أن «١٫٥٪ من كهرباء العالم ذكاء اصطناعي» فهو يبالغ. ذلك رقم مراكز البيانات كلها، وهي تفعل كل ما تفعله مراكز البيانات.

الرقم الذي يقتبسه الجميع يخصّ مراكز البيانات كلها، بكل ما تفعله. أما حصّة الذكاء الاصطناعي منه فغير منشورة على حدة، وهذا المخطّط يقول ذلك بدل اختراع شريحة.

الأرقام التي بُني عليها هذا المخطّط
كهرباء العالم ~28,000 TWh
مراكز البيانات كلها 415 TWh · 1.5%
حصّة الذكاء الاصطناعي منها غير منشورة على حدة
IEA, Energy and AI, April 2025. 2024 figures

وفي الماء تتباعد التقديرات بمراتب قدر، ويستحقّ السبب أن يُعرف. قدّرت أعمال أكاديمية استهلاك تدريب GPT-3 من الماء بنحو ٧٠٠ ألف لتر، ومن عشرة إلى خمسين ردّاً متوسّطاً بنحو نصف لتر. وقدّر سام ألتمان الاستعلام الواحد بـ٠٫٣٢ ملّيلتر؛ وقدّرت غوغل مطالبة نصّية وسيطة في «جيميناي» بنحو ٠٫٢٦ ملّيلتر — خمس قطرات. وكلا رقمَي الشركتين ذاتي التصريح ويرسم حدود النظام ضيّقة، عند الاستدلال وحده عادةً، ومستبعداً في الغالب استهلاك محطة التوليد نفسها. وليست أي من المجموعتين كاذبة. إنهما تقيسان أشياء مختلفة، ولا يكاد أحد يقول أيّها.

الحدث نفسه، مقيساً بطريقتين. وكل خلاف تقريباً حول الذكاء الاصطناعي والماء هو خلاف على موضع حدّ النظام.

الأرقام التي بُني عليها هذا المخطّط
تبريد الموقع فقط~0.7M
شاملاً ماء توليد الكهرباء~5.4M
Li et al., Making AI Less “Thirsty”, 2023. Training GPT-3

لجدل السلامة ثلاثة أطراف لا طرفان

1

على جانب، «التسريعية الفعّالة»: التقدّم التقني بلا قيود بوصفه حلّاً لمشكلات البشرية، ومعارضة التنظيم، ورفض الخطر الوجودي بوصفه لا يُذكر، ووسم المنتقدين بـ«المتشائمين» أو «المبطّئين». بدأت في مايو ٢٠٢٢ بأربعة حسابات مستعارة، ثم اكتسبت بياناً وعدداً من المستثمرين البارزين.

2

وعلى الجانب الآخر، موقف الخطر الوجودي. ففي مايو ٢٠٢٣ نشر «مركز سلامة الذكاء الاصطناعي» بياناً من جملة واحدة: ينبغي أن يكون تخفيف خطر الانقراض بسبب الذكاء الاصطناعي أولوية عالمية إلى جانب الأوبئة والحرب النووية. ووقّعه هينتون وبينجيو وألتمان وحسّابيس وأمودي. واللافت يستحقّ قولاً صريحاً: الذين يبنون هذه التقنية وقّعوا بياناً يقول إنها قد تقتل الجميع، ثم مضوا في بنائها.

3

أما الموقف الثالث فيُمحى من معظم التغطية. يرى بندر وغبرو وميتشل والباحثون حولهم أن المعسكرين يتشاركان مقدّمة واحدة — أن هذه الأنظمة هائلة القوة أو ستصير كذلك وشيكاً — وأن الخطر الوجودي والتسريعية وجهان للنزعة التي تفترض أن التكنولوجيا قادرة وحدها على حلّ المشكلات الاجتماعية والسياسية. واعتراضهم أن كليهما يصرف الانتباه عن أضرار حاضرة موثّقة: استغلال العمالة في وسم البيانات، والاستيلاء غير المعوَّض على الأعمال الإبداعية، والكلفة البيئية، وتركّز السلطة في حفنة شركات.

وغادر جيفري هينتون غوغل في ١ مايو ٢٠٢٣ ليتكلّم بحرية، وسطّحت التغطية شيئاً يستحقّ الاستعادة: ففي اليوم نفسه أوضح أنه غادر ليتحدّث عن المخاطر دون أن يحسب أثر ذلك على غوغل، وأن غوغل «تصرّفت بمسؤولية عالية». لم يستقل ليهاجم صاحب عمله. وبحلول ديسمبر ٢٠٢٤ قدّر احتمال تسبّب الذكاء الاصطناعي في انقراض البشر خلال ثلاثة عقود بـ١٠ إلى ٢٠ بالمئة.

وتحرّكت الحوكمة في الاتجاه المعاكس للخطاب. وقّعت ثماني وعشرون دولة والاتحاد الأوروبي «إعلان بلتشلي» في نوفمبر ٢٠٢٣. وبحلول قمة باريس في فبراير ٢٠٢٥ امتنعت الولايات المتحدة والمملكة المتحدة عن توقيع البيان الختامي. ودخل «قانون الذكاء الاصطناعي الأوروبي» حيّز النفاذ في ١ أغسطس ٢٠٢٤ بعتبة «خطر نظامي» مكتوبة كعدد عمليات فاصلة عائمة — ١٠²⁵ — وهي في ذاتها أثر لافت من آثار هذه الحقبة: قانون مكتوب فيه عدد عمليات حسابية.

ثماني روايات شائعة لا تصمد أمام المصادر

لا شيء من هذه التصويبات يجعل التاريخ أبهت. بل أكثرها يجعله أحدّ.

الدليل الذي يكرّر الرواية المرتّبة لكل قصة دليل لطيف عديم النفع. وهذه أكثر ثمانية ادّعاءات تكراراً في هذا التاريخ لا تصمد أمام المصادر — ومنها واحد تخطئ فيه المكتبة التي تحفظ المخطوطة على موقعها هي.

الرواية التي سمعتها «بيت الحكمة» في بغداد كان أكاديمية بحثية كبرى بمرصد ومدرسة ترجمة وهيئة تدريس.

ما تقوله المصادر الطرح التنقيحي، وهو ما يتبنّاه هذا الدليل، أنه كان مكتبة لا أكاديمية — والأمانة تقتضي نسبة الطرح إلى أصحابه. فشكله الدقيق ودوره في حركة الترجمة بل وموقعه المادي كلها لا تزال موضع جدل؛ والصورة الشائعة عن «جامعة العصور الوسطى» هي ما يفكّكه التنقيحيون، وهم يبيّنون كيف رُكّبت من سوء ترجمة: قرأ فلوغل «صاحب بيت الحكمة» (أي أمين المكتبة) على أنه مؤلف كتاب، وأضاف بروكلمان المرصد، وأضاف مايرهوف مدرسة الترجمة، وحمل حتّي الصيغة المزوَّقة إلى جمهور واسع. وكما يقول أكمل الدين إحسان أوغلو: «تقف الحقيقة العارية غريباً غير مرحَّب به، وتقف الأسطورة معرفةً أليفة في البيت». وهذا لا ينتقص من الخوارزمي في شيء. إنه يعني فقط أن الدراما تخصّ الرجل وحركة الترجمة، لا مبنى لم يوجد.

الرواية التي سمعتها كتبت آدا لوفليس أن المحرّك التحليلي «لا يدّعي أنه يبتكر شيئاً» — دليلاً على أنها أنكرت إبداع الآلة.

ما تقوله المصادر كتبت «لا يدّعي البتة»، والجملتان السابقتان لها لا تكادان تُقتبسان أبداً. وهما تحذّران من المبالغة في تقدير موضوع جديد، ثم — بردّ فعل طبيعي — من بخسه حقّه. والملاحظة (ز) مقروءةً كاملةً تحذيرٌ من المبالغة في الاتجاهين، لا نفيٌ قاطع. وقد أخطأ تورنغ في اقتباسها مرتين سنة ١٩٥٠: أسقط كلمة «البتة»، وأرّخ المذكّرة بـ١٨٤٢ وهي الأصل الفرنسي لمِنابريا لا ترجمتها هي سنة ١٨٤٣. بل إن صفحة مكتبة البودليان نفسها تكتب «علاقات تحليلية» على أنها «تجلّيات تحليلية»، وتُسقط جملة بصمت.

الرواية التي سمعتها بنى تورنغ «كولوسوس» واستخدمه لكسر «إنيغما».

ما تقوله المصادر خطآن في جملة واحدة. آلة تورنغ كانت «البُمب» — كهروميكانيكية، موجّهة إلى «إنيغما»، ومبنيّة على سبع سنوات من عمل بولندي سابق لفريق ماريان ريفسكي. أما «كولوسوس» فصمّمه تومي فلاورز، مهندس في هيئة البريد، عن مخططات لماكس نيومان، وكان يهاجم «لورنتس»، وهو نظام مختلف تماماً وأشدّ سرّية يحمل مراسلات هتلر وجنرالاته. وقد استنتج بيل توت البنية الداخلية لآلة لورنتس دون أن يراها قط، وهو أعظم إنجاز فردي في تحليل الشفرات في الحرب، ويكاد لا يُعرف.

الرواية التي سمعتها شعار أبل تحية لتفاحة تورنغ المسمومة.

ما تقوله المصادر نفاها كلٌّ من المصمّم روب جانوف وستيف جوبز. قصة جميلة، وغير صحيحة. أما الصحيح ونادراً ما يُقال: التفاحة التي كانت بجوار سرير تورنغ لم تُفحص قط بحثاً عن السيانيد، وقد جادل الفيلسوف جاك كوبلاند جدّياً بأن نتائج التشريح تنسجم مع الاستنشاق أكثر من الابتلاع — فقد كان تورنغ يحتفظ في بيته بجهاز طلاء كهربائي يستخدم سيانيد البوتاسيوم. حكم الانتحار هو النتيجة الرسمية؛ وطرح كوبلاند اعتراض علمي لا نظرية مؤامرة.

الرواية التي سمعتها غريس هوبر وجدت أول «علّة» حاسوبية — عثّة — ومن هناك جاءت الكلمة.

ما تقوله المصادر مشغّلو «هارفارد مارك ٢» هم من عثروا على العثّة في ٩ سبتمبر ١٩٤٧ ولصقوها في السجلّ. أما هوبر فروت القصة عقوداً وجعلتها مشهورة، وهذا أمر آخر ومشرّف. والكلمة أقدم من ذلك بكثير: اشتكى إديسون في رسالة سنة ١٨٧٨ من «العِلَل — كما تُسمّى هذه الأعطال والصعوبات الصغيرة». ولهذا بالضبط كُتب في السجلّ: «أول حالة فعلية لعثور على علّة». إنها تورية، ولا تنجح إلا لأن المصطلح كان مستقرّاً أصلاً. الرواية الصحيحة أفضل من الأسطورة.

الرواية التي سمعتها «ملك − رجل + امرأة = ملكة» تثبت أن متجهات الكلمات تلتقط المعنى.

ما تقوله المصادر شيفرة word2vec الأصلية تمنع صراحةً إعادة أي من الكلمات الثلاث المُدخلة. وقد شغّلها نِسيم وفان نورد وفان دير خوت بلا قيد سنة ٢٠٢٠ فانهار الأداء: عواصم الدول من ٨٣٫٢٪ إلى ٤٤٫٥٪، والجموع من ٨٦٫٠٪ إلى ٤٫٧٪، والأضداد من ٤٢٫٧٪ إلى ١٫٧٪. وفي معظم حالات الفشل تكون الإجابة العائدة هي الكلمة المُدخلة نفسها — «رجل إلى ملك كامرأة إلى ملك». الهندسة حقيقية، لكنها أضعف بكثير مما يوحي به العرض، والعرض يعتمد على أدوات القياس. والورقة نفسها تنصف الجهة الأخرى: المتجهات تشفّر تحيّزات بشرية فعلاً، وما تلاحظه دون أن تتصيّده مقلق بما يكفي.

الرواية التي سمعتها ChatGPT كان أسرع تطبيق استهلاكي نمواً في التاريخ — ١٠٠ مليون مستخدم في شهرين.

ما تقوله المصادر جاء ذلك الرقم من مذكّرة محلّل في «يو بي إس» مبنيّة على نمذجة حركة المواقع من «سيميلارويب». ولم تؤكّده أوبن إيه آي قط، وهو مستخدمون نشطون شهرياً، وهذا لا يقارَن بأرقام النشاط الأسبوعي التي نشرتها الشركة بعد ذلك. النمو كان استثنائياً فعلاً — كتب محلّلو «يو بي إس» أنهم في عشرين عاماً من تغطية الإنترنت لا يذكرون صعوداً أسرع — ثم كسر «ثريدز» من ميتا رقم التسجيلات بعد ثمانية أشهر. قل إنه كان استثنائياً؛ ولا تحوّل تقدير محلّل إلى واقعة.

الرواية التي سمعتها درّبت ديب سيك نموذجاً في الصدارة بـ٥٫٦ ملايين دولار.

ما تقوله المصادر الرقم حقيقي وموجود في الورقة — والورقة تقول فوراً بعده ما الذي لا يشمله. إنه تكلفة عملية التدريب المسبق النهائية، مسعّرة بسعر إيجار مفترَض قدره دولاران لساعة معالج H800، لعتاد تملكه ديب سيك أصلاً. ولا يشمل البحث السابق ولا تجارب الاستبعاد ولا خط البيانات ولا الرواتب ولا العمليات الفاشلة. وقدّرت «سيميأنالِسِس» إنفاق الشركة الرأسمالي على الخوادم بنحو ١٫٦ مليار دولار. لكن دعوى الكفاءة الأساسية تصمد دون الحاجة إلى الـ٥٫٦ ملايين: فبأرقام الدليل نفسه، تقدّر «إيبوك إيه آي» حوسبة V3 بـ٣٫٣×١٠²⁴ عملية فاصلة عائمة مقابل تقدير مركزي قدره ٢٫١×١٠²⁵ لـ GPT-4. أي بفارق نحو ستة أضعاف — وهو فارق حقيقي يستحقّ الذكر، لكنه ليس «مرتبة عشرية» كما يُقرَّب عادةً. وكلا الرقمين تقدير، وهما يقارنان عمليتَي التدريب النهائيتين لا كل ما أنتجهما. وتلك هي القصة، دون الحاجة إلى الـ٥٫٦ ملايين.

ثلاث طرق لقراءة القصة كلها

ثلاث طرق لتحمل ألفاً ومئتي سنة في رأسك دفعةً واحدة. وهي ليست متنافسة؛ إنها مقاطع مختلفة في المادة نفسها.

  1. 1

    قصة عنق الزجاجة

    كل قفزة أزالت قيداً بعينه. متجهات الكلمات الثابتة صارت سياقية. والمتجه الثابت للجملة صار انتباهاً. والحساب المتتابع صار متوازياً. والتدريب الخاصّ بمهمّة صار تعلّماً في السياق. والقادر-عديم-النفع صار RLHF. والعمالقة ناقصو التدريب صاروا مدرَّبة وفق النسبة المثلى بين حجم النموذج وكمية البيانات التي بيّنتها «تشينتشيلا». والإجابة الفورية صارت حوسبة وقت اختبار. والحوسبة الكثيفة صارت متفرّقة. وكل فتح يبدو بديهياً بأثر رجعي وكان خفيّاً قبله — وهذا جدير بالتذكّر قبل افتراض أن عنق الزجاجة الحالي دائم.

  2. 2

    لمن يُنسب الفضل؟

    بحدانوف اخترع الانتباه وبينجيو سمّاه في مراجعة أخيرة. غوغل اخترعت ترانسفورمر وفقدت مؤلّفيها الثمانية. و«أوبن إيه آي» كفّت عن نشر ما تبنيه، مستشهدةً بالمشهد التنافسي في نفس النَّفَس الذي ذكرت فيه السلامة. و«ديب سيك» نشرت كل شيء وخسرت السردية لرقم في جدول. ولوفليس كتبت الفكرة الأكبر ويُتجادل حولها في الأصغر. ومن يُذكَرون نادراً ما يكونون من فعلوا الشيء.

  3. 3

    إيقاعان مختلفان

    القدرة تتحرك على ساعة سريعة: انتقل GPQA من ٣٦٪ إلى ٩٥٪ في ثلاث سنوات، والرقم القياسي اليوم بيد نموذج رخيص. والمؤسسات تتحرك على ساعة بطيئة: أول حكم أمريكي موضوعي ضدّ تدريب الذكاء الاصطناعي صدر في فبراير ٢٠٢٥، بعد خمس سنوات من رفع تلك الدعوى وثماني سنوات من ترانسفورمر. والتوتر المثير في ٢٠٢٦ ليس بين الإنسان والآلة. إنه الفجوة المتّسعة بين ما تستطيعه هذه الأنظمة وما قرّره أحدٌ فعلاً بشأنها.

توقّف شانون عند أربعة حروف من السياق لأن الجهد صار هائلاً. وكل ما جرى في الثمانية والسبعين عاماً الأخيرة هو قصة إزالة ذلك القيد — والشيء القائم على الجهة الأخرى منه لا يزال عاجزاً عن أن يخبرك بموثوقية أين وُلد شخص ما. ونصفا هذه الجملة صحيحان، وأي رواية تعطيك أحدهما فقط لا تصف التقنية. إنها تبيع موقفاً منها.

ماذا يعني هذا لك؟

إن كنت تقرّر ماذا تشغّل، وأين تشغّله، وما المسموح لك فعله بالبيانات، فتلك محادثة أخرى غير هذه — وهي عادةً محادثة من خمس عشرة دقيقة.

احجز مكالمة مجانية 15 دقيقة

من أين جاء هذا

كل اقتباس في هذه الصفحة منقول من المصدر المذكور بجانبه. وحيث تعذّر التحقّق من ادّعاء شائع مقابل مصدر أوّلي، حُذف أو وُسم بأنه محلّ خلاف بدل تكراره. وأرقام ٢٠٢٦ من مجموعات بيانات «إيبوك إيه آي» العامة، المحمَّلة في ٢٠ أغسطس ٢٠٢٦، ومن إعلانات المصنّعين.