نماذج الذكاء الاصطناعي العامة تتفوق على الأدوات المتخصصة في المجال الطبي

“`html

نماذج الذكاء الاصطناعي العامة تتفوق على الأدوات المتخصصة في المجال الطبي

تبدأ الأدوات الخاصة بالذكاء الاصطناعي المصممة خصيصًا للاستخدام الطبي في فرض نفسها في الممارسة السريرية، لكن تقييمها المستقل لا يزال نادرًا. قام تحليل حديث بمقارنة أداتين من هذه الأدوات، OpenEvidence وUpToDate Expert AI، مع ثلاثة من نماذج الذكاء الاصطناعي العامة الرائدة: GPT-5.2 وGemini 3.1 Pro وClaude Opus 4.6. جرت عملية التقييم في ثلاث مراحل متميزة.

تمثلت المرحلة الأولى في تقديم 500 سؤال من نوع امتحانات الطب الأمريكية للنماذج لاختبار معارفها. حقق النماذج العامة نتائج أفضل، مع درجات تجاوزت 90٪ من الإجابات الصحيحة. حقق Gemini دقة بلغت 97.4٪، يليه GPT بنسبة 94.2٪، بينما حصدت الأدوات المتخصصة درجات أقل، حول 88 إلى 89٪.

تضمنت المرحلة الثانية تقييم التوافق مع الأحكام السريرية من خلال 500 حالة مستمدة من قاعدة بيانات HealthBench. برزت النماذج العامة مرة أخرى. حقق GPT أعلى درجة بنسبة 88٪، يليه Gemini بنسبة 79.3٪ وClaude بنسبة 77٪. أما الأدوات المتخصصة، فقد حصدت نتائج أقل إقناعًا بكثير، مع درجات أقل من 63٪.

أخيرًا، شملت المرحلة الثالثة 100 استفسار سريري حقيقي طرحها أطباء في بيئة مستشفائية. قام اثنا عشر طبيبًا أمريكيًا بتقييم إجابات النماذج الستة بشكل أعمى، مما أدى إلى 1800 تعليق. هيمنت النماذج العامة مرة أخرى، مع درجات متوسطة تجاوزت 3.5 من 4. حصدت الأدوات المتخصصة وأداة تحليل Google درجات أقل، حول 3.2. كانت الفروق واضحة بشكل خاص من حيث الوضوح، حيث أظهرت OpenEvidence نقاط ضعف ملحوظة، مع إجابات كانت في بعض الأحيان غير مكتملة أو غير منظمة أو غير ملائمة للجمهور الطبي.

أظهرت الأدوات المتخصصة أيضًا معدل رفض أعلى، حيث رفض UpToDate الإجابة على 19٪ من الأسئلة، مقارنة بـ 1 إلى 3٪ فقط للنماذج العامة. لم ينتج أي نموذج محتوى خطيرًا أو أخطاء واقعية أكثر من غيره، مما يشير إلى أن الأمان ليس نقطة تميز رئيسية بينهم.

تكشف هذه الدراسة عن نتيجة مدهشة: بفضل تدريبها الواسع ومواءمتها المتقدمة، تتفوق النماذج العامة على الأدوات المتخصصة في مهام طبية متنوعة. يبدو أن قدرتها على التفكير ودمج المعارف العامة تعوض، بل وتتفوق على، الميزة المفترضة للتخصص الطبي. تكافح الأدوات المخصصة، على الرغم من تصميمها للاستخدام السريري، من أجل منافسة تعدد استخدامات ودقة النماذج الأكثر تقدمًا.

كما تسلط النتائج الضوء على أهمية التقييم الدقيق والمستقل قبل اعتماد هذه التقنيات في البيئة الطبية. قد تطرح المعايير التقليدية، التي يتم إنشاؤها في كثير من الأحيان من قبل نفس الفاعلين الذين طوروا النماذج، تحيزات. لذلك، ركزت الدراسة على الاستفسارات الحقيقية، التي تم تقييمها من قبل الأطباء دون معرفة مصدر الإجابات، لضمان مقارنة موضوعية.

قد تمثل النماذج العامة حلًا أكثر فعالية للمهام السريرية الشائعة، بينما قد تجد الأدوات المتخصصة فائدتها في المجالات المتخصصة جدًا أو السياقات التي تتطلب تكاملًا متقدمًا مع أنظمة مستشفائية محددة. ومع ذلك، فإن تفوقها الحالي ليس مضمونًا مع مرور الوقت، حيث يمكن أن تغير التطور السريع لهذه التقنيات من موازين القوى.

“`


Sources et crédits

Étude source

DOI : https://doi.org/10.1038/s41591-026-04431-5

Titre : General-purpose large language models outperform specialized clinical AI tools on medical benchmarks

Revue : Nature Medicine

Éditeur : Springer Science and Business Media LLC

Auteurs : Krithik Vishwanath; Anton Alyakin; Mrigayu Ghosh; Ali Hage; Sean N. Neifert; Cordelia Orillac; Nataniel J. Mandelberg; Hammad A. Khan; Jin Vivian Lee; Jie J. Yao; William Robert Small; Aakaash Varma; D. Brock Hewitt; Yindalon Aphinyanaphongs; Daniel Alexander Alber; Eric Karl Oermann

Speed Reader

Ready
500