Close Menu
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
  • منشور اخلاقی سیمرغ
  • درباره ما
  • ارتباط با ما
  • آموزش و منابع آموزشی
    • کاربردهای هوش مصنوعی در صنایع
    • کتاب های هوش مصنوعی
    • مقالات هوش مصنوعی
  • رویدادها
    • دوره های آموزشی
    • سمینار
    • کارگاه
    • کنفرانس
    • مصاحبه‌ها
X (Twitter) Instagram YouTube LinkedIn Telegram
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
  • خانه
  • اخبار و مقالات
    • پزشکی
    • بازاریابی و تبلیغات
    • حمل و نقل
    • کشاورزی
    • حقوق و قضا
    • مالی و بانکی
    • هنر و خلاقیت
    • تولید و صنعت
    • آموزش
    • محیط زیست
    • بخش انرژی
    • امنیتی و دفاعی
    • مصاحبه‌ها
    • View All On Demos
  • رویدادها
    • سمینار
    • کنفرانس
    • وبینار
    • دوره های آموزشی
  • آموزش‌ها

    معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش

    شهریور 22, 1405

    راهنمای بهینه‌سازی پرامپت‌ها در جی پی تی ۶ آسترا

    شهریور 21, 1405

    ورود دستیار هوش مصنوعی به گوگل فوتوز

    شهریور 14, 1405

    محاسبه گر هوشمند استهلاک خودرو

    مرداد 27, 1405

    هوش مصنوعی Kimi K۳

    تیر 27, 1405
  • ابزارها
    1. چت‌بات‌ها و مدل‌های زبانی (LLMs & Chatbots)
    2. ابزارهای آموزش و یادگیری (Education & Learning AI)
    3. ابزارهای بهره‌وری و مدیریت (Productivity)
    4. ابزارهای تخصصی هوش مصنوعی (Advanced AI Tools)
    5. ابزارهای علم داده و دیتاساینس( Data Science & Analytics tools)
    6. ابزارهای امنیت، حریم خصوصی و سایبر (AI Security Tools)
    7. ابزارهای تحقیق، پژوهش و مقاله‌نویسی (AI Research Tools)
    8. ابزارهای بازاریابی و سئو (AI Marketing & SEO Tools)
    9. ابزارهای تولید صدا و موسیقی (AI Audio & Music Tools)
    10. ابزارهای کدنویسی و توسعه نرم‌افزار (AI Coding Tools)
    11. View All

    معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش

    شهریور 22, 1405

    راهنمای بهینه‌سازی پرامپت‌ها در جی پی تی ۶ آسترا

    شهریور 21, 1405

    مدل GPT-۶ Astra: تحولی در کدنویسی و امنیت سایبری

    شهریور 20, 1405

    OpenAI محدودیت چت رایگان ChatGPT را حذف کرد

    مرداد 16, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    Google Illuminate: راز جدید گوگل برای یادگیری سریع

    آذر 14, 1404

    هوش مصنوعی NotebookLM

    آذر 13, 1404

    Google Scholar Labs | گوگل اسکولار لبز چیست؟

    آبان 29, 1404

    Claude Cowork برای نسخه‌های موبایل و وب عرضه می‌شود

    تیر 16, 1405

    بروزرسانی Google Workspace

    اردیبهشت 3, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    راهنمای بهینه‌سازی پرامپت‌ها در جی پی تی ۶ آسترا

    شهریور 21, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    مدل‌های Gemma ۴ QAT : فشرده‌سازی مدل‌ها برای موبایل و لپ‌تاپ

    خرداد 16, 1405

    هوش مصنوعی GPT-۵.۴؛ مدل جدید OpenAI

    فروردین 17, 1405

    نسل جدید بینایی هوشمند با Gemini ۳ Pro

    آذر 16, 1404

    کلاد‌ای آی در نقش هکر

    تیر 11, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    هوش مصنوعی جما – Gemma ۴ گوگل

    فروردین 15, 1405

    معرفی «Prism»: فضای کار ابری مبتنی بر هوش مصنوعی برای نوشتن مقالات علمی

    بهمن 19, 1404

    دسترسی کامل‌تر به گوگل و امکانات پیشرفته‌تر با Google AI Pro

    بهمن 12, 1404

    مدل GPT-۶ Astra: تحولی در کدنویسی و امنیت سایبری

    شهریور 20, 1405

    هوش مصنوعی Grok ۴.۵

    تیر 18, 1405

    Tokenmaxxing | توکن‌مکسینگ یا «بیشینه‌سازی توکن»

    فروردین 29, 1405

    هوش مصنوعی GPT-۵.۴؛ مدل جدید OpenAI

    فروردین 17, 1405

    هوش مصنوعی جسم دارد/ندارد؟ Embodied AI

    خرداد 17, 1405

    کاربرد هوش مصنوعی در ردیابی گوشی گم‌شده: انقلابی در امنیت دیجیتال

    مهر 30, 1401

    تولید آیفون ۱۴، ۲۰ درصد گران‌تر از آیفون ۱۳ است

    مهر 30, 1401

    مایکروسافت قصد دارد نمای دسکتاپ یا موبایل را در نوار کناری Edge معرفی کند

    مهر 30, 1401
  • خرید اشتراک سالانه
  • ارتباط با ما
    • منشور اخلاقی سیمرغ
    • ارتباط با ما
    • درباره ما
  • اپلیکیشن سیمرغ GPT
Instagram YouTube LinkedIn Telegram
رسانه تخصصی هوش مصنوعی سیمرغرسانه تخصصی هوش مصنوعی سیمرغ
خانه - اپلیکیشن - V-JEPA ۲ مدل جدید متا
V-JEPA 2 مدل جدید متا
V-JEPA 2 مدل جدید متا

V-JEPA ۲ مدل جدید متا

0
By سهراب اسکندری on خرداد 22, 1404 اپلیکیشن, ابزارها و گجت‌ها
اشتراک‌ با دوستان
Facebook Twitter LinkedIn Pinterest Telegram Email WhatsApp Copy Link

V-JEPA ۲ مدل جدید متا: هوش مصنوعی متا با تماشای یک میلیون ساعت ویدیو، دنیا را می‌آموزد

شرکت متا از یک مدل هوش مصنوعی جدید به نام V-JEPA 2 رونمایی کرده است که می‌تواند با مشاهده حجم عظیمی از داده‌های ویدیویی، به درک عمیقی از دنیای فیزیکی دست یابد، آینده را پیش‌بینی کند و حتی برای ربات‌ها برنامه‌ریزی کند. این دستاورد گامی مهم در مسیر ساخت سیستم‌های هوشمندی است که مانند انسان‌ها، عمدتاً از طریق مشاهده یاد می‌گیرند و قادر به تعامل با محیط‌های جدید و ناآشنا هستند.

این مقاله که در تاریخ ۱۰ ژوئن ۲۰۲۵ منتشر شده است ، نشان می‌دهد چگونه می‌توان با ترکیب داده‌های ویدیویی اینترنتی در مقیاس بزرگ و مقدار کمی داده‌های تعاملی ربات، یک مدل سراسری(World Model) ساخت که پایه‌ای برای نسل بعدی هوش مصنوعی خواهد بود.

V-JEPA ۲ چیست و چگونه یاد می‌گیرد؟

یکی از چالش‌های اصلی هوش مصنوعی مدرن، یادگیری درک جهان و نحوه عمل در آن از طریق مشاهده است. V-JEPA ۲ بر اساس یک معماری یادگیری خودنظارتی به نام معماری پیش‌بینی-تعبیه‌سازی مشترک (JEPA) کار می‌کند. برخلاف مدل‌های مولد که سعی در پیش‌بینی تک‌تک پیکسل‌های یک ویدیو دارند (مثلاً جزئیات برگ‌های یک درخت)، رویکرد JEPA بر یادگیری بازنمایی‌های انتزاعی از جنبه‌های قابل پیش‌بینی یک صحنه تمرکز می‌کند.

به زبان ساده، این مدل با مشاهده بخش‌هایی از یک ویدیو، تلاش می‌کند تا بازنمایی (representation) بخش‌های پنهان‌شده یا ماسک‌گذاری‌شده آن را پیش‌بینی کند. این فرآیند به مدل اجازه می‌دهد تا قوانین فیزیکی و پویایی جهان را بدون نیاز به برچسب‌گذاری دستی و به شکلی کارآمد بیاموزد.

این مدل در مرحله اول روی یک مجموعه داده عظیم شامل بیش از ۱ میلیون ساعت ویدیوی اینترنتی و ۱ میلیون تصویر پیش‌آموزش داده شده است.

دستورالعمل موفقیت: چهار عنصر کلیدی در مقیاس‌پذیری

محققان برای دستیابی به عملکرد چشمگیر V-JEPA ۲، چهار عامل کلیدی را بهبود بخشیدند که تأثیر مستقیم بر افزایش دقت مدل داشته است.

  1. مقیاس‌پذیری داده (Data Scaling): افزایش حجم مجموعه داده از ۲ میلیون به ۲۲ میلیون ویدیو، بهبود قابل توجهی در عملکرد ایجاد کرد.
  2. مقیاس‌پذیری مدل (Model Scaling): معماری انکودر از ۳۰۰ میلیون پارامتر به بیش از ۱ میلیارد پارامتر افزایش یافت.
  3. آموزش طولانی‌تر (Longer Training): افزایش تعداد تکرارهای آموزش از ۹۰ هزار به ۲۵۲ هزار، به بهره‌برداری مؤثرتر از داده‌های اضافی کمک کرد.
  4. رزولوشن بالاتر (Higher Resolution): استفاده از یک استراتژی آموزشی پیشرونده، امکان آموزش کارآمد با ویدیوهای طولانی‌تر و رزولوشن بالاتر را فراهم کرد.

تأثیر هر یک از این مداخلات در جدول زیر خلاصه شده است که میانگین دقت در شش وظیفه طبقه‌بندی را نشان می‌دهد.

مداخله (Intervention)میانگین دقت (Average Accuracy)بهبود نسبت به مرحله قبل
خط پایه VJEPA ۱ 84.2%–
+ مقیاس‌پذیری داده 85.2%۱.۰+ امتیاز
+ مقیاس‌پذیری مدل 86.7%۱.۵+ امتیاز
+ آموزش طولانی‌تر 87.5%۰.۸+ امتیاز
+ رزولوشن بالاتر 88.2%۰.۷+ امتیاز

V-JEPA ۲ در عمل: یک تهدید سه‌گانه

این مدل در سه حوزه اصلی توانایی‌های خود را به نمایش می‌گذارد: درک، پیش‌بینی و برنامه‌ریزی.

V-JEPA 2 مدل جدید متا
V-JEPA ۲ مدل جدید متا

۱. درک عمیق ویدیو (Understanding)

V-JEPA ۲ توانایی فوق‌العاده‌ای در درک محتوای بصری دارد، به ویژه در وظایفی که نیازمند فهم حرکت هستند.

  • طبقه‌بندی کنش: این مدل در مجموعه داده Something-Something v2 که نیازمند درک دقیق حرکت است، به دقت 77.3% در طبقه‌بندی top-۱ دست یافت.
  • پاسخ به سوالات ویدیویی (Video QA): پس از همراستاسازی با یک مدل زبان بزرگ (LLM)، V-JEPA ۲ در چندین بنچمارک درک دنیای فیزیکی و استدلال زمانی به عملکردی پیشرفته در کلاس مدل‌های ۸ میلیارد پارامتری دست یافت. برای مثال، در بنچمارک Perception Test به دقت 84.0% و در TempCompass به دقت 76.9% رسید. این نشان می‌دهد که یک انکودر ویدیویی که بدون نظارت زبان آموزش دیده، می‌تواند با موفقیت با یک LLM همراستا شود و به نتایج پیشرفته‌ای دست یابد.

۲. پیش‌بینی آینده (Prediction)

توانایی پیش‌بینی اقدامات آینده یکی از نقاط قوت کلیدی V-JEPA ۲ است.

  • پیش‌بینی کنش انسان: در بنچمارک چالش‌برانگیز Epic-Kitchens-100، این مدل به رکورد 39.7% recall-at-5 دست یافت که یک بهبود نسبی ۴۴ درصدی نسبت به بهترین مدل قبلی محسوب می‌شود. این مدل می‌تواند با مشاهده چند ثانیه از فعالیت یک فرد در آشپزخانه، عمل بعدی او (مانند “برداشتن چاقو” یا “بستن در”) را با دقت بالایی پیش‌بینی کند.

۳. برنامه‌ریزی برای دنیای واقعی (Planning)

شگفت‌انگیزترین قابلیت V-JEPA ۲، استفاده از آن برای برنامه‌ریزی رباتیک است. محققان یک نسخه شرطی‌شده بر عمل (Action-Conditioned) به نام V-JEPA 2-AC را توسعه دادند.

  • آموزش کارآمد: این مدل تنها با استفاده از کمتر از ۶۲ ساعت ویدیوی ربات بدون برچسب از مجموعه داده Droid آموزش دیده است.
  • استقرار صفر-شات (Zero-shot): V-JEPA ۲-AC به صورت صفر-شات (بدون هیچ‌گونه آموزش اضافی یا جمع‌آوری داده در محیط جدید) روی بازوهای رباتیک Franka در دو آزمایشگاه مختلف مستقر شد.
  • انجام وظایف: ربات‌ها تنها با دریافت یک تصویر از حالت نهایی (Goal Image)، توانستند وظایف برداشتن و جابجایی اشیاء (Pick-and-Place) را با موفقیت انجام دهند. این کار بدون هیچ‌گونه آموزش خاص برای وظیفه یا سیگنال پاداش صورت گرفت.

V-JEPA ۲-AC در مقابل رقبا: یک مقایسه عملی

عملکرد V-JEPA ۲-AC در وظایف رباتیک با دو مدل دیگر مقایسه شد: یک مدل مبتنی بر کلون‌سازی رفتار (Octo) و یک مدل سراسری مبتنی بر تولید ویدیو (Cosmos). نتایج نشان‌دهنده برتری قابل توجه V-JEPA ۲-AC است.

جدول مقایسه نرخ موفقیت در وظایف رباتیک (میانگین دو آزمایشگاه)

روشرسیدن (Reach)گرفتن فنجان (Grasp Cup)گرفتن جعبه (Grasp Box)جابجایی فنجان (P&P Cup)جابجایی جعبه (P&P Box)
Octo100%15%0%15%10%
V-JEPA ۲-AC (ما)100%65%25%80%65%

علاوه بر نرخ موفقیت بالاتر، V-JEPA ۲-AC از نظر محاسباتی نیز بسیار کارآمدتر است. در حالی که برنامه‌ریزی یک عمل با مدل Cosmos حدود ۴ دقیقه زمان می‌برد، مدل V-JEPA ۲-AC همین کار را تنها در ۱۶ ثانیه انجام می‌دهد و به عملکرد بهتری نیز دست می‌یابد.

چالش‌ها و آینده پیش رو

با وجود نتایج امیدوارکننده، این تحقیق با محدودیت‌هایی نیز روبروست که مسیر تحقیقات آینده را مشخص می‌کند:

  • حساسیت به موقعیت دوربین: عملکرد مدل تا حدی به زاویه دوربین وابسته است و باید به طور ضمنی محورهای مختصات را از ورودی دوربین استنتاج کند.
  • برنامه‌ریزی بلندمدت: برنامه‌ریزی برای افق‌های زمانی طولانی بدون نیاز به اهداف میانی (sub-goals) همچنان یک چالش است، زیرا خطاهای پیش‌بینی در طول زمان انباشته می‌شوند.
  • وابستگی به اهداف تصویری: در حال حاضر، اهداف به صورت تصویر به مدل داده می‌شوند. گام بعدی، فعال کردن تعیین اهداف از طریق زبان طبیعی است.

نتیجه‌گیری

V-JEPA ۲ یک گام مهم به سوی ساخت مدل‌های سراسری پیشرفته است که می‌توانند به طور مؤثری دنیای اطراف خود را درک کرده و در محیط واقعی عملکرد درست و دقیق از خود به نمایش بگذارند. این تحقیق نشان می‌دهد که یادگیری خودنظارتی در مقیاس وب، همراه با حجم کمی از داده‌های تعاملی، می‌تواند پایه‌ای قدرتمند برای ساخت سیستم‌های هوش مصنوعی توانمند در درک، پیش‌بینی و برنامه‌ریزی در دنیای فیزیکی فراهم کند. این رویکرد نه تنها در وظایف درک بصری به نتایج پیشرفته‌ای دست یافته ، بلکه پتانسیل خود را برای کنترل ربات‌های دنیای واقعی به صورت صفر-شات نیز به اثبات رسانده است.

منبع
س
سهراب اسکندری دنبال‌شده
۶ دنبال‌کننده دنبال‌کردن در لینکدین
تلگرام واتساپ ایکس
نظرت چیه؟
V-JEPA 2 چیست V-JEPA 2 مدل جدید متا
Share. Facebook Twitter Pinterest LinkedIn Tumblr Email
Previous Articleورود هوش مصنوعی به بخش حقوقی
Next Article دیباگ خودکار با Code Researcher

پست‌های مشابه

معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش

راهنمای بهینه‌سازی پرامپت‌ها در جی پی تی ۶ آسترا

بازی امپراتور منچ‌بازها

ورود دستیار هوش مصنوعی به گوگل فوتوز

محاسبه گر هوشمند استهلاک خودرو

OpenAI محدودیت چت رایگان ChatGPT را حذف کرد

Add A Comment
Leave A Reply Cancel Reply

برای نوشتن دیدگاه باید وارد بشوید.

پیشنهاد ویژه محصولات هوشمند سیمرغ
درباره رسانه هوش مصنوعی سیمرغ

در رسانه تخصصی هوش مصنوعی سیمرغ، ما فراتر از یک پایگاه خبری عمل می‌کنیم. ما آینده‌ای نوین را با قدرت دانش و فناوری می‌سازیم. از تحلیل عمیق جدیدترین پیشرفت‌های هوش مصنوعی تا معرفی ابزارهای نوآورانه، رسالت ما این است که جامعه‌ای آگاه و پیشرو در این حوزه ایجاد کنیم.

🌍 بزرگترین جامعه هوش مصنوعی خاورمیانه
📡 آخرین اخبار، تحلیل‌ها و آموزش‌های تخصصی
🚀 همراهی با متخصصان، استارتاپ‌ها و علاقه‌مندان هوش مصنوعی

🔗 همین حالا به سیمرغ بپیوندید و آینده را با ما رقم بزنید!
📩 تماس با ما: [email protected]
🌐 وب‌سایت: simorghai.ir

X (Twitter) Instagram YouTube LinkedIn Discord Telegram
درباره ما ارتباط با ما منشور اخلاقی سیمرغ راهنمای خبرنگاران افتخاری
      📩 عضویت در خبرنامه لینکدین
لوگو خبری رسانه هوش مصنوعی سیمرغ لوگو خبری رسانه هوش مصنوعی سیمرغ
logo-samandehi
نوشته‌های تازه
  • هشدار کارمند سابق درباره هوش مصنوعی؛ واکنش مدیران شرکت‌های بزرگ
  • گوگل به سرقت کد متن باز مینی تپ گوگل در پروژه هوش مصنوعی آرتمیس متهم شد
  • ابلاغ قانون توسعه هوش مصنوعی از سوی رئیس مجلس به رئیس‌جمهور
  • معرفی مدل دیپ‌سیک V۴.۱ با پنجره ۱ میلیونی و کاهش شدید هزینه کش
  • جزئیات طرح مهار هوش مصنوعی از سوی مدیرعامل آنتروپیک اعلام شد
رسانه تخصصی هوش مصنوعی سیمرغ
X (Twitter) Instagram YouTube LinkedIn Telegram WhatsApp
بازنشر مطالب هوش مصنوعی سیمرغ تحت هر عنوانی غیر مجاز و پیگرد قانونی دارد.
طراحی شده توسط سیمرغ ای آی © 1405.

Type above and press Enter to search. Press Esc to cancel.

ورود به حساب کاربری

برای ادامه، وارد حساب کاربری خود شوید

ورود با گوگل
یا
#
رمز عبور را فراموش کرده‌اید؟

حساب کاربری ندارید؟ ثبت‌نام کنید

کد اپلیکیشن احرازکننده یا یکی از کدهای پشتیبان را وارد کنید

افزونه مسدود کننده تبلیغات شما فعال است!
افزونه مسدود کننده تبلیغات شما فعال است!
وب‌سایت ما با نمایش تبلیغات آنلاین به بازدیدکنندگان‌ ادامه حیات میدهد! لطفاً با غیرفعال کردن افزونه مسدودکننده تبلیغات‌ مرورگرتان از تیم سیمرغ حمایت کنید.