Close Menu
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
  • منشور اخلاقی سیمرغ
  • درباره ما
  • ارتباط با ما
  • آموزش و منابع آموزشی
    • کاربردهای هوش مصنوعی در صنایع
    • کتاب های هوش مصنوعی
    • مقالات هوش مصنوعی
  • رویدادها
    • دوره های آموزشی
    • سمینار
    • کارگاه
    • کنفرانس
    • مصاحبه‌ها
X (Twitter) Instagram YouTube LinkedIn Telegram
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
  • خانه
  • اخبار و مقالات
    • پزشکی
    • بازاریابی و تبلیغات
    • حمل و نقل
    • کشاورزی
    • حقوق و قضا
    • مالی و بانکی
    • هنر و خلاقیت
    • تولید و صنعت
    • آموزش
    • محیط زیست
    • بخش انرژی
    • امنیتی و دفاعی
    • مصاحبه‌ها
    • View All On Demos
  • رویدادها
    • سمینار
    • کنفرانس
    • وبینار
    • دوره های آموزشی
  • آموزش‌ها

    هوش مصنوعی Qwen۳.۸-Omni-Flash

    شهریور 28, 1405

    افزونه ChatGPT مایکروسافت ورد منتشر شد؛ از نگارش پیش‌نویس تا بررسی گرامر

    شهریور 27, 1405

    لینک دانلود اپ اندروید و آیفون ابزارهای هوش مصنوعی

    شهریور 26, 1405

    آموزش دانلود و نصب نانو بنانا (Nano Banana) در اندروید و آیفون [سال ۱۴۰۵]

    شهریور 25, 1405

    معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش

    شهریور 22, 1405
  • ابزارها
    1. چت‌بات‌ها و مدل‌های زبانی (LLMs & Chatbots)
    2. ابزارهای آموزش و یادگیری (Education & Learning AI)
    3. ابزارهای بهره‌وری و مدیریت (Productivity)
    4. ابزارهای تخصصی هوش مصنوعی (Advanced AI Tools)
    5. ابزارهای علم داده و دیتاساینس( Data Science & Analytics tools)
    6. ابزارهای امنیت، حریم خصوصی و سایبر (AI Security Tools)
    7. ابزارهای تحقیق، پژوهش و مقاله‌نویسی (AI Research Tools)
    8. ابزارهای بازاریابی و سئو (AI Marketing & SEO Tools)
    9. ابزارهای تولید صدا و موسیقی (AI Audio & Music Tools)
    10. ابزارهای کدنویسی و توسعه نرم‌افزار (AI Coding Tools)
    11. View All

    هوش مصنوعی Qwen۳.۸-Omni-Flash

    شهریور 28, 1405

    هوش مصنوعی Astra for Law

    شهریور 27, 1405

    افزونه ChatGPT مایکروسافت ورد منتشر شد؛ از نگارش پیش‌نویس تا بررسی گرامر

    شهریور 27, 1405

    راهکارهای کاهش مصرف توکن Claude

    شهریور 23, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    Google Illuminate: راز جدید گوگل برای یادگیری سریع

    آذر 14, 1404

    هوش مصنوعی NotebookLM

    آذر 13, 1404

    Google Scholar Labs | گوگل اسکولار لبز چیست؟

    آبان 29, 1404

    Claude Cowork برای نسخه‌های موبایل و وب عرضه می‌شود

    تیر 16, 1405

    بروزرسانی Google Workspace

    اردیبهشت 3, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    راهنمای بهینه‌سازی پرامپت‌ها در جی پی تی ۶ آسترا

    شهریور 21, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    مدل‌های Gemma ۴ QAT : فشرده‌سازی مدل‌ها برای موبایل و لپ‌تاپ

    خرداد 16, 1405

    هوش مصنوعی GPT-۵.۴؛ مدل جدید OpenAI

    فروردین 17, 1405

    نسل جدید بینایی هوشمند با Gemini ۳ Pro

    آذر 16, 1404

    کلاد‌ای آی در نقش هکر

    تیر 11, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    هوش مصنوعی جما – Gemma ۴ گوگل

    فروردین 15, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    دسترسی کامل‌تر به گوگل و امکانات پیشرفته‌تر با Google AI Pro

    بهمن 12, 1404

    مدل GPT-۶ Astra: تحولی در کدنویسی و امنیت سایبری

    شهریور 20, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    Tokenmaxxing | توکن‌مکسینگ یا «بیشینه‌سازی توکن»

    فروردین 29, 1405

    هوش مصنوعی GPT-۵.۴؛ مدل جدید OpenAI

    فروردین 17, 1405

    هوش مصنوعی جسم دارد/ندارد؟ Embodied AI

    خرداد 17, 1405

    کاربرد هوش مصنوعی در ردیابی گوشی گم‌شده: انقلابی در امنیت دیجیتال

    مهر 30, 1401

    عشق در عصر دیجیتال:هوش مصنوعی جایگزینی برای روابط واقعی؟

    دی 23, 1399

    انقلاب هوش مصنوعی در صنعت با ایسوس!

    دی 15, 1399
  • خرید اشتراک سالانه
  • ارتباط با ما
    • منشور اخلاقی سیمرغ
    • ارتباط با ما
    • درباره ما
  • اپلیکیشن سیمرغ GPT
Instagram YouTube LinkedIn Telegram
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
خانه - چت‌بات‌ها و مدل‌های زبانی (LLMs & Chatbots) - هوش مصنوعی Qwen۳.۸-Omni-Flash
هوش مصنوعی Qwen3.8-Omni-Flash
هوش مصنوعی Qwen3.8-Omni-Flash

هوش مصنوعی Qwen۳.۸-Omni-Flash

0
By سهراب اسکندری on شهریور 28, 1405 چت‌بات‌ها و مدل‌های زبانی (LLMs & Chatbots), ابزارها و گجت‌ها, اپلیکیشن, شاخص‌ها
اشتراک‌ با دوستان
Facebook Twitter LinkedIn Pinterest Telegram Email WhatsApp Copy Link

Qwen3.۸-Omni-Flash معرفی شد؛ مدل چندوجهی Qwen با تمرکز بر اجرای وظایف صوتی و ویدیویی

Alibaba مدل Qwen3.8-Omni-Flash را به‌عنوان نسل جدید مدل بومی چندوجهی (Omnimodal) خود معرفی کرد؛ مدلی که علاوه بر درک متن، تصویر، صدا و ویدیو، برای برنامه‌ریزی وظایف، استفاده از ابزارها و اجرای فرایندهای چندمرحله‌ای طراحی شده است. این مدل با پنجره زمینه یک میلیون توکنی عرضه شده و تمرکز ویژه‌ای بر کاربردهای عملیاتی در حوزه‌هایی مانند ویرایش ویدیو، تولید موزیک‌ویدیو، ترجمه، تولید محتوای صوتی‌تصویری و تعامل بلادرنگ دارد.

هوش مصنوعی Qwen3.8-Omni-Flash

درک هم‌زمان متن، تصویر، صدا و ویدیو

Qwen3.۸-Omni-Flash ورودی‌های متنی، تصویری، صوتی و ویدیویی را در یک پنجره زمینه ۱ میلیون توکنی پردازش می‌کند. طبق نتایج اعلام‌شده، میانگین امتیاز این مدل در ۲۹ ارزیابی بیش از ۲۵ درصد بالاتر از Qwen3.۵-Omni-Plus است.

«

Alibaba همچنین اعلام کرده قیمت API برای هر ساعت ورودی صوتی بیش از ۹۸ درصد و برای ورودی صوتی‌تصویری بیش از ۹۳ درصد کاهش یافته است. در ارزیابی‌های مربوط به عامل‌های صوتی‌تصویری، برنامه‌نویسی و وظایف طولانی، این مدل در WildClawBench-MM بهبود ۳۶.۵ امتیازی و در AgenticVBench بهبود ۲۲.۳ امتیازی نسبت به Qwen3.۵-Omni-Plus داشته و در UniClawBench امتیاز ۶۹.۶ را به دست آورده است.

این مدل درک صوت و ویدیوی طولانی، استدلال صوتی‌تصویری، تولید توضیحات برای محتوای صوتی‌تصویری و تشخیص چند گوینده را نیز بهبود داده است. Qwen می‌گوید عملکرد صوتی‌تصویری این مدل به Gemini ۳.۸ Flash نزدیک شده و عملکرد کلی آن در حوزه صوت از Gemini ۳.۸ Flash فراتر رفته است.

عامل هوشمند برای ویدیوهای طولانی

یکی از قابلیت‌های Qwen3.۸-Omni-Flash، درک عامل‌محور ویدیوهای طولانی است. به‌جای پردازش کامل یک ویدیوی چندساعته، مدل می‌تواند ابتدا سؤال را بررسی کند، سپس مشخص کند کدام بخش‌های ویدیو و صدا برای یافتن پاسخ اهمیت دارند و با چند مرحله جمع‌آوری شواهد، روی همان قسمت‌ها تمرکز کند.

در OmniVideoBench، استفاده از این روش امتیاز دقت را از ۶۳.۴ به ۶۷.۸ رسانده و مصرف توکن را از ۱۴۵٬۷۳۶ به ۷۹٬۱۱۷ توکن کاهش داده است؛ یعنی حدود ۴۵.۷ درصد کاهش مصرف توکن.

تبدیل جلسات ویدیویی به اقدامات قابل اجرا

Qwen3.۸-Omni-Flash می‌تواند در جلسات چندنفره، گویندگان را از طریق صدا و تصویر شناسایی کند و تا یک ساعت ورودی صوتی‌تصویری را به‌صورت بومی پردازش کند. این مدل قادر است تفکیک گویندگان، رونویسی محتوا و تطبیق هویت افراد را به‌صورت یکپارچه انجام دهد.

بر اساس توضیحات Qwen، با دریافت ویدیوی کامل جلسه و یک درخواست مشخص، مدل می‌تواند روابط میان شرکت‌کنندگان را ترسیم کند، صورت‌جلسه بسازد، اقدامات موردنیاز را استخراج و ریسک‌های پروژه را تحلیل کند. در ترکیب با عامل‌ها و ابزارهای نرم‌افزاری، حتی امکان ارسال ایمیل، سازمان‌دهی وظایف و شروع فرایند کدنویسی بر اساس نیازهای مطرح‌شده در جلسه نیز وجود دارد.

از تحلیل ویدیو تا پژوهش عمیق

Qwen3.۸-Omni-Flash می‌تواند محتوای یک ویدیو را در کنار نیاز کاربر بررسی کند و پرسش‌هایی را که نیازمند تحقیق بیشتر هستند شناسایی کند. سپس با جست‌وجو در منابع چندوجهی وب، از جمله تصویر، ویدیو و اسناد، اطلاعات مرتبط را گردآوری و در قالب یک گزارش پژوهشی متمرکز بر ویدیو ارائه می‌دهد.

تولید موزیک‌ویدیو و ترجمه ویدیو

در قابلیت Music2MV، مدل ساختار، ریتم، حال‌وهوا، آواز و تغییرات سازهای یک آهنگ را تحلیل می‌کند تا در طراحی شخصیت‌ها، صحنه‌ها و نماهای موزیک‌ویدیو مورد استفاده قرار گیرد. همچنین می‌تواند متن ترانه را در سطح خط و همراه با زمان‌بندی تولید کند تا هماهنگی میان آواز، زیرنویس و تصویر امکان‌پذیر شود.

در ترجمه ویدیوهای داستانی کوتاه نیز Qwen3.۸-Omni-Flash می‌تواند تشخیص گفت‌وگو بر اساس گوینده، ترجمه، شبیه‌سازی صدای شخصیت‌ها، دوبله، میکس صدا و کنترل کیفیت نهایی را در قالب یک فرایند یکپارچه انجام دهد.

Qwen همچنین قابلیت تولید ویدیوهای نقد و تحلیل فیلم‌های بلند را معرفی کرده است. طبق توضیحات این شرکت، عامل مبتنی بر مدل می‌تواند از درک فیلم و استخراج بخش‌های کلیدی تا برنامه‌ریزی نقد، تولید گویندگی و موسیقی، تدوین، رندر و بررسی نهایی را انجام دهد.

مدل بزرگ برای بهبود مدل کوچک‌تر

یکی دیگر از آزمایش‌های Qwen3.۸-Omni-Flash، استفاده از خود مدل برای توسعه یک مدل کوچک‌تر است. Qwen به مدل وظیفه داده است که در مدت ۱۲ ساعت تشخیص گفتار لهجه سیچوانی در Qwen2.5-Omni-3B را بهبود دهد.

مدل به‌صورت مستقل مجموعه ارزیابی WenetSpeech-Chuan را انتخاب، معیارهای ارزیابی را تعیین و عملکرد پایه را ایجاد کرد. سپس با بررسی نمونه‌های صوتی و نتایج تشخیص، مشکلات را شناسایی و داده آموزشی هدفمند تولید کرد.

در چهار دور آزمایش متوالی، این عامل ۳٬۴۱۳ نمونه آموزشی ایجاد کرد و بر اساس بازخورد ارزیابی، روش خود را تغییر داد، بهبودهای مؤثر را حفظ کرد و تلاش‌های ناموفق را کنار گذاشت. در نهایت، نرخ خطای کاراکتری Qwen2.۵-Omni-3B در همان مجموعه ارزیابی از ۲۵.۷۹ درصد به ۱۵.۳۰ درصد کاهش یافت؛ یعنی حدود ۴۰.۷ درصد کاهش نسبی.

تبدیل ویدیوهای طولانی به دانش ساختاریافته

Qwen برای تبدیل محتوای ویدیویی به منابع قابل استفاده مجدد، قابلیت متن‌باز Video2Note را در مجموعه Qwen-MM-Plugins ارائه کرده است. این ابزار با درک هم‌زمان گفتار، تصویر و مراحل انجام کار، دانش ویدیویی را سازمان‌دهی می‌کند، مراحل کلیدی را استخراج و فریم‌های نماینده را انتخاب می‌کند و در نهایت یادداشت‌های PDF شامل متن و تصویر می‌سازد.

قابلیت متن‌باز Omni Skill Creator نیز می‌تواند از ویدیوهای آموزشی، ضبط صفحه یا نمایش نحوه انجام یک کار، رویه‌های استاندارد عملیاتی (SOP) استخراج کند و آن‌ها را به مهارت‌های قابل استفاده مجدد برای عامل‌ها تبدیل کند.

Qwen3.۸-Omni-Flash-Realtime برای تعامل بلادرنگ

Alibaba در کنار مدل اصلی، Qwen3.8-Omni-Flash-Realtime را برای تعامل صوتی‌تصویری بلادرنگ معرفی کرده است. این مدل می‌تواند جریان زنده صدا و تصویر را دریافت و هم‌زمان پاسخ تولید کند و بر اساس زمینه لحظه‌ای، ابزارها را فراخوانی و وظایف را اجرا کند.

این مدل از WebSocket و WebRTC پشتیبانی می‌کند و برای کاربردهایی مانند تمرین مکالمه، تعامل صوتی‌تصویری و اجرای وظایف در لحظه طراحی شده است.

Qwen همچنین قابلیتی برای درک فضایی صدا معرفی کرده است که صدا را به‌عنوان یک محور مکانی در کنار تصویر در نظر می‌گیرد. طبق ادعای شرکت، مدل می‌تواند جهت و فاصله منبع صوتی را همراه با موانع و مسیرهای قابل حرکت تشخیص دهد و بر اساس صدا، هدف را مکان‌یابی کند.

پشتیبانی از زبان فارسی

Qwen3.۸-Omni-Flash در بخش تشخیص گفتار از ۷۴ زبان و در بخش تولید گفتار از ۲۹ زبان پشتیبانی می‌کند. فارسی نیز در هر دو فهرست قرار دارد.

Qwen-MM-Plugins و Qwen-Live Harness متن‌باز شدند

Qwen برای استفاده از قابلیت‌های چندوجهی مدل در محیط‌های عامل‌محور، مجموعه Qwen-MM-Plugins را توسعه داده است. این مجموعه از درک تصویر، صوت، ویدیو و اسناد، حافظه برای ویدیوهای طولانی و تولید محتوا پشتیبانی می‌کند و با محیط‌هایی مانند Codex، Claude Code، Qwen Code، Gemini CLI، Qoder، CodeBuddy و OpenClaw سازگار است.

همچنین Qwen-Live Harness به‌عنوان یک چارچوب متن‌باز برای کار با API بلادرنگ Qwen3.۸-Omni-Flash-Realtime عرضه شده است. این چارچوب قابلیت‌هایی مانند واگذاری وظایف، تعامل پیش‌دستانه، حافظه بلندمدت و مدیریت زمینه را پوشش می‌دهد.

Qwen3.۸-Omni-Flash اکنون در پلتفرم Qianwen AI در دسترس است و API آن از رابط‌های سازگار با استانداردهای OpenAI، از جمله Chat Completions و Responses API، پشتیبانی می‌کند.

منبع: Qwen

نتایج بنچمارک

س
سهراب اسکندری دنبال‌شده
۷ دنبال‌کننده دنبال‌کردن در لینکدین
تلگرام واتساپ ایکس
نظرت چیه؟
مدل کیون هوش مصنوعی Qwen3.8-Omni-Flash
Share. Facebook Twitter Pinterest LinkedIn Tumblr Email
Previous Articleآنتروپیک: از کشف دارو تا توسعه بالینی

پست‌های مشابه

آنتروپیک: از کشف دارو تا توسعه بالینی

هوش مصنوعی Astra for Law

افزونه ChatGPT مایکروسافت ورد منتشر شد؛ از نگارش پیش‌نویس تا بررسی گرامر

لینک دانلود اپ اندروید و آیفون ابزارهای هوش مصنوعی

آموزش دانلود و نصب نانو بنانا (Nano Banana) در اندروید و آیفون [سال ۱۴۰۵]

مدیرعامل انویدیا خطاب به ترامپ: اجازه نمی‌دهیم روند توسعه هوش مصنوعی کند شود!

Add A Comment
Leave A Reply Cancel Reply

برای نوشتن دیدگاه باید وارد بشوید.

پیشنهاد ویژه محصولات هوشمند سیمرغ
درباره رسانه هوش مصنوعی سیمرغ

در رسانه تخصصی هوش مصنوعی سیمرغ، ما فراتر از یک پایگاه خبری عمل می‌کنیم. ما آینده‌ای نوین را با قدرت دانش و فناوری می‌سازیم. از تحلیل عمیق جدیدترین پیشرفت‌های هوش مصنوعی تا معرفی ابزارهای نوآورانه، رسالت ما این است که جامعه‌ای آگاه و پیشرو در این حوزه ایجاد کنیم.

🌍 بزرگترین جامعه هوش مصنوعی خاورمیانه
📡 آخرین اخبار، تحلیل‌ها و آموزش‌های تخصصی
🚀 همراهی با متخصصان، استارتاپ‌ها و علاقه‌مندان هوش مصنوعی

🔗 همین حالا به سیمرغ بپیوندید و آینده را با ما رقم بزنید!
📩 تماس با ما: [email protected]
🌐 وب‌سایت: simorghai.ir

X (Twitter) Instagram YouTube LinkedIn Discord Telegram
درباره ما ارتباط با ما منشور اخلاقی سیمرغ راهنمای خبرنگاران افتخاری
      📩 عضویت در خبرنامه لینکدین
لوگو خبری رسانه هوش مصنوعی سیمرغ لوگو خبری رسانه هوش مصنوعی سیمرغ
نماد اعتماد الکترونیکی logo-samandehi
نوشته‌های تازه
  • هوش مصنوعی Qwen۳.۸-Omni-Flash
  • آنتروپیک: از کشف دارو تا توسعه بالینی
  • هوش مصنوعی Astra for Law
  • افزونه ChatGPT مایکروسافت ورد منتشر شد؛ از نگارش پیش‌نویس تا بررسی گرامر
  • شورش‌های کوچک در جعبه سیاه OpenAI
رسانه تخصصی هوش مصنوعی سیمرغ
X (Twitter) Instagram YouTube LinkedIn Telegram WhatsApp
بازنشر مطالب هوش مصنوعی سیمرغ تحت هر عنوانی غیر مجاز و پیگرد قانونی دارد.
طراحی شده توسط سیمرغ ای آی © 1405.

Type above and press Enter to search. Press Esc to cancel.

ورود به حساب کاربری

برای ادامه، وارد حساب کاربری خود شوید

ورود با گوگل
یا
#
رمز عبور را فراموش کرده‌اید؟

حساب کاربری ندارید؟ ثبت‌نام کنید

کد اپلیکیشن احرازکننده یا یکی از کدهای پشتیبان را وارد کنید

افزونه مسدود کننده تبلیغات شما فعال است!
افزونه مسدود کننده تبلیغات شما فعال است!
وب‌سایت ما با نمایش تبلیغات آنلاین به بازدیدکنندگان‌ ادامه حیات میدهد! لطفاً با غیرفعال کردن افزونه مسدودکننده تبلیغات‌ مرورگرتان از تیم سیمرغ حمایت کنید.