DeepSeek تطلق واجهة الرؤية متعددة الوسائط
أعلنت شركة ديب سيك عن إطلاق النموذج التجريبي متعدد الوسائط DeepSeek-V4-Flash-Vision-Exp على منصة واجهة برمجة التطبيقات الخاصة بها، مما يوسع نطاق قدراتها في معالجة النصوص والصور ضمن إطار عمل موحد. يحقق النموذج الجديد أداءً نصياً يعادل النسخة الأساسية في مهام الوكيل الذكي والتفكير المنطقي والمعرفة العامة، ويسجل قفزة كبيرة في اختبارات الوكلاء متعددي الوسائط، ليقترب من مستوى أداء نموذج Opus-4.8. يدعم الإصدار الجديد الإمداد ببيانات مدخلات هجينة تجمع بين النصوص والصور، مع إمكانية استخدام صيغ متعددة مثل الترميز القاعدي أو الروابط الخارجية أو واجهة الملفات المطورة، كما يتكامل بسلاسة مع أطر عمل الوكلاء الذكيين لدمج الفهم البصري مع مجموعة واسعة من الأدوات التشغيلية. يتوفر النموذج عبر تحديد المعرف البرمجي في الطلبات، مع فرض رسوم ترميز للصور تصل إلى ثلاثمائة وأربعة وثمانين رمزاً لكل صورة وفقاً لأسعار الفئة الأساسية. وبموازاة ذلك، أطلقت الشركة واجهة برمجة التطبيقات الخاصة بالملفات Files API المجانية، والتي تتيح رفع الصور مرة واحدة والرجوع إليها عبر معرف فريد، مما يلغي الحاجة لإعادة الرفع ويوفر عرض النطاق الترددي مع تعزيز إعادة الاستخدام عبر الطلبات المتعددة. كما صدر تحديث Harness 0.1.1 المدعوم بدمج مباشر مع النموذج الجديد، مما يسهل عملية النشر والتجربة المباشرة. يعكس هذا الإعلان خطوة استراتيجية نحو تبسيط سير العمل متعدد الوسائط في الذكاء الاصطناعي التوليدي، ويوفر للمطورين والباحثين بيئة أكثر كفاءة لبناء أنظمة ذكية قادرة على معالجة البيانات المرئية والنصية معاً بدقة عالية.
