رسانه تخصصی هوش مصنوعی سیمرغ

هوش مصنوعی Qwen۳.۸-Omni-Flash

هوش مصنوعی Qwen3.8-Omni-Flash

Qwen3.۸-Omni-Flash معرفی شد؛ مدل چندوجهی Qwen با تمرکز بر اجرای وظایف صوتی و ویدیویی

Alibaba مدل Qwen3.8-Omni-Flash را به‌عنوان نسل جدید مدل بومی چندوجهی (Omnimodal) خود معرفی کرد؛ مدلی که علاوه بر درک متن، تصویر، صدا و ویدیو، برای برنامه‌ریزی وظایف، استفاده از ابزارها و اجرای فرایندهای چندمرحله‌ای طراحی شده است. این مدل با پنجره زمینه یک میلیون توکنی عرضه شده و تمرکز ویژه‌ای بر کاربردهای عملیاتی در حوزه‌هایی مانند ویرایش ویدیو، تولید موزیک‌ویدیو، ترجمه، تولید محتوای صوتی‌تصویری و تعامل بلادرنگ دارد.

هوش مصنوعی Qwen3.8-Omni-Flash

درک هم‌زمان متن، تصویر، صدا و ویدیو

Qwen3.۸-Omni-Flash ورودی‌های متنی، تصویری، صوتی و ویدیویی را در یک پنجره زمینه ۱ میلیون توکنی پردازش می‌کند. طبق نتایج اعلام‌شده، میانگین امتیاز این مدل در ۲۹ ارزیابی بیش از ۲۵ درصد بالاتر از Qwen3.۵-Omni-Plus است.

Alibaba همچنین اعلام کرده قیمت API برای هر ساعت ورودی صوتی بیش از ۹۸ درصد و برای ورودی صوتی‌تصویری بیش از ۹۳ درصد کاهش یافته است. در ارزیابی‌های مربوط به عامل‌های صوتی‌تصویری، برنامه‌نویسی و وظایف طولانی، این مدل در WildClawBench-MM بهبود ۳۶.۵ امتیازی و در AgenticVBench بهبود ۲۲.۳ امتیازی نسبت به Qwen3.۵-Omni-Plus داشته و در UniClawBench امتیاز ۶۹.۶ را به دست آورده است.

این مدل درک صوت و ویدیوی طولانی، استدلال صوتی‌تصویری، تولید توضیحات برای محتوای صوتی‌تصویری و تشخیص چند گوینده را نیز بهبود داده است. Qwen می‌گوید عملکرد صوتی‌تصویری این مدل به Gemini ۳.۸ Flash نزدیک شده و عملکرد کلی آن در حوزه صوت از Gemini ۳.۸ Flash فراتر رفته است.

عامل هوشمند برای ویدیوهای طولانی

یکی از قابلیت‌های Qwen3.۸-Omni-Flash، درک عامل‌محور ویدیوهای طولانی است. به‌جای پردازش کامل یک ویدیوی چندساعته، مدل می‌تواند ابتدا سؤال را بررسی کند، سپس مشخص کند کدام بخش‌های ویدیو و صدا برای یافتن پاسخ اهمیت دارند و با چند مرحله جمع‌آوری شواهد، روی همان قسمت‌ها تمرکز کند.

در OmniVideoBench، استفاده از این روش امتیاز دقت را از ۶۳.۴ به ۶۷.۸ رسانده و مصرف توکن را از ۱۴۵٬۷۳۶ به ۷۹٬۱۱۷ توکن کاهش داده است؛ یعنی حدود ۴۵.۷ درصد کاهش مصرف توکن.

تبدیل جلسات ویدیویی به اقدامات قابل اجرا

Qwen3.۸-Omni-Flash می‌تواند در جلسات چندنفره، گویندگان را از طریق صدا و تصویر شناسایی کند و تا یک ساعت ورودی صوتی‌تصویری را به‌صورت بومی پردازش کند. این مدل قادر است تفکیک گویندگان، رونویسی محتوا و تطبیق هویت افراد را به‌صورت یکپارچه انجام دهد.

بر اساس توضیحات Qwen، با دریافت ویدیوی کامل جلسه و یک درخواست مشخص، مدل می‌تواند روابط میان شرکت‌کنندگان را ترسیم کند، صورت‌جلسه بسازد، اقدامات موردنیاز را استخراج و ریسک‌های پروژه را تحلیل کند. در ترکیب با عامل‌ها و ابزارهای نرم‌افزاری، حتی امکان ارسال ایمیل، سازمان‌دهی وظایف و شروع فرایند کدنویسی بر اساس نیازهای مطرح‌شده در جلسه نیز وجود دارد.

از تحلیل ویدیو تا پژوهش عمیق

Qwen3.۸-Omni-Flash می‌تواند محتوای یک ویدیو را در کنار نیاز کاربر بررسی کند و پرسش‌هایی را که نیازمند تحقیق بیشتر هستند شناسایی کند. سپس با جست‌وجو در منابع چندوجهی وب، از جمله تصویر، ویدیو و اسناد، اطلاعات مرتبط را گردآوری و در قالب یک گزارش پژوهشی متمرکز بر ویدیو ارائه می‌دهد.

تولید موزیک‌ویدیو و ترجمه ویدیو

در قابلیت Music2MV، مدل ساختار، ریتم، حال‌وهوا، آواز و تغییرات سازهای یک آهنگ را تحلیل می‌کند تا در طراحی شخصیت‌ها، صحنه‌ها و نماهای موزیک‌ویدیو مورد استفاده قرار گیرد. همچنین می‌تواند متن ترانه را در سطح خط و همراه با زمان‌بندی تولید کند تا هماهنگی میان آواز، زیرنویس و تصویر امکان‌پذیر شود.

در ترجمه ویدیوهای داستانی کوتاه نیز Qwen3.۸-Omni-Flash می‌تواند تشخیص گفت‌وگو بر اساس گوینده، ترجمه، شبیه‌سازی صدای شخصیت‌ها، دوبله، میکس صدا و کنترل کیفیت نهایی را در قالب یک فرایند یکپارچه انجام دهد.

Qwen همچنین قابلیت تولید ویدیوهای نقد و تحلیل فیلم‌های بلند را معرفی کرده است. طبق توضیحات این شرکت، عامل مبتنی بر مدل می‌تواند از درک فیلم و استخراج بخش‌های کلیدی تا برنامه‌ریزی نقد، تولید گویندگی و موسیقی، تدوین، رندر و بررسی نهایی را انجام دهد.

مدل بزرگ برای بهبود مدل کوچک‌تر

یکی دیگر از آزمایش‌های Qwen3.۸-Omni-Flash، استفاده از خود مدل برای توسعه یک مدل کوچک‌تر است. Qwen به مدل وظیفه داده است که در مدت ۱۲ ساعت تشخیص گفتار لهجه سیچوانی در Qwen2.5-Omni-3B را بهبود دهد.

مدل به‌صورت مستقل مجموعه ارزیابی WenetSpeech-Chuan را انتخاب، معیارهای ارزیابی را تعیین و عملکرد پایه را ایجاد کرد. سپس با بررسی نمونه‌های صوتی و نتایج تشخیص، مشکلات را شناسایی و داده آموزشی هدفمند تولید کرد.

در چهار دور آزمایش متوالی، این عامل ۳٬۴۱۳ نمونه آموزشی ایجاد کرد و بر اساس بازخورد ارزیابی، روش خود را تغییر داد، بهبودهای مؤثر را حفظ کرد و تلاش‌های ناموفق را کنار گذاشت. در نهایت، نرخ خطای کاراکتری Qwen2.۵-Omni-3B در همان مجموعه ارزیابی از ۲۵.۷۹ درصد به ۱۵.۳۰ درصد کاهش یافت؛ یعنی حدود ۴۰.۷ درصد کاهش نسبی.

تبدیل ویدیوهای طولانی به دانش ساختاریافته

Qwen برای تبدیل محتوای ویدیویی به منابع قابل استفاده مجدد، قابلیت متن‌باز Video2Note را در مجموعه Qwen-MM-Plugins ارائه کرده است. این ابزار با درک هم‌زمان گفتار، تصویر و مراحل انجام کار، دانش ویدیویی را سازمان‌دهی می‌کند، مراحل کلیدی را استخراج و فریم‌های نماینده را انتخاب می‌کند و در نهایت یادداشت‌های PDF شامل متن و تصویر می‌سازد.

قابلیت متن‌باز Omni Skill Creator نیز می‌تواند از ویدیوهای آموزشی، ضبط صفحه یا نمایش نحوه انجام یک کار، رویه‌های استاندارد عملیاتی (SOP) استخراج کند و آن‌ها را به مهارت‌های قابل استفاده مجدد برای عامل‌ها تبدیل کند.

Qwen3.۸-Omni-Flash-Realtime برای تعامل بلادرنگ

Alibaba در کنار مدل اصلی، Qwen3.8-Omni-Flash-Realtime را برای تعامل صوتی‌تصویری بلادرنگ معرفی کرده است. این مدل می‌تواند جریان زنده صدا و تصویر را دریافت و هم‌زمان پاسخ تولید کند و بر اساس زمینه لحظه‌ای، ابزارها را فراخوانی و وظایف را اجرا کند.

این مدل از WebSocket و WebRTC پشتیبانی می‌کند و برای کاربردهایی مانند تمرین مکالمه، تعامل صوتی‌تصویری و اجرای وظایف در لحظه طراحی شده است.

Qwen همچنین قابلیتی برای درک فضایی صدا معرفی کرده است که صدا را به‌عنوان یک محور مکانی در کنار تصویر در نظر می‌گیرد. طبق ادعای شرکت، مدل می‌تواند جهت و فاصله منبع صوتی را همراه با موانع و مسیرهای قابل حرکت تشخیص دهد و بر اساس صدا، هدف را مکان‌یابی کند.

پشتیبانی از زبان فارسی

Qwen3.۸-Omni-Flash در بخش تشخیص گفتار از ۷۴ زبان و در بخش تولید گفتار از ۲۹ زبان پشتیبانی می‌کند. فارسی نیز در هر دو فهرست قرار دارد.

Qwen-MM-Plugins و Qwen-Live Harness متن‌باز شدند

Qwen برای استفاده از قابلیت‌های چندوجهی مدل در محیط‌های عامل‌محور، مجموعه Qwen-MM-Plugins را توسعه داده است. این مجموعه از درک تصویر، صوت، ویدیو و اسناد، حافظه برای ویدیوهای طولانی و تولید محتوا پشتیبانی می‌کند و با محیط‌هایی مانند Codex، Claude Code، Qwen Code، Gemini CLI، Qoder، CodeBuddy و OpenClaw سازگار است.

همچنین Qwen-Live Harness به‌عنوان یک چارچوب متن‌باز برای کار با API بلادرنگ Qwen3.۸-Omni-Flash-Realtime عرضه شده است. این چارچوب قابلیت‌هایی مانند واگذاری وظایف، تعامل پیش‌دستانه، حافظه بلندمدت و مدیریت زمینه را پوشش می‌دهد.

Qwen3.۸-Omni-Flash اکنون در پلتفرم Qianwen AI در دسترس است و API آن از رابط‌های سازگار با استانداردهای OpenAI، از جمله Chat Completions و Responses API، پشتیبانی می‌کند.

منبع: Qwen

نتایج بنچمارک

سهراب اسکندری
دنبال‌کردن در لینکدین
نظرت چیه؟
Exit mobile version