- خانهتکنولوژیهوش مصنوعی
مدل چندوجهی FLUX 3 قادر به تولید ویدیو ۲۰ ثانیهای با صدا و هدایت رباتها است.
در دیجیاتو ثبتنام کنید
جهت بهرهمندی و دسترسی به امکانات ویژه و بخشهای مختلف در دیجیاتو عضو ویژه دیجیاتو شوید.
- مدیرعامل انویدیا ترس از نابودی مشاغل توسط هوش مصنوعی را کاملاً بیمعنا دانست42 دقیقه قبلهوش مصنوعی جمینای گوگل حالا نزدیک ۱ میلیارد کاربر فعال ماهانه دارد1 ساعت قبلگوگل از قابلیت ورود به حساب کاربری با ضبط ویدیو سلفی پرده برداشت [تماشا کنید]1 ساعت قبلحالت صوتی Claude با مدلهای قویتر و امکان اتصال به ابزارهایی مثل جیمیل ارتقا پیدا کرد [تماشا کنید]2 ساعت قبلپژوهش جدید: خودشیفتهها بیشتر در معرض وابستگی به چتباتها هستند14 ساعت قبل
استارتاپ Black Forest Labs با معرفی مدل جدید FLUX 3، دامنه فعالیتهای خود را از تولید تصویر به سوی مدلهای پیشرو چندوجهی گسترش داده است. این مدل هوشمند نهتنها قادر به درک و تولید تصویر است، بلکه میتواند از طریق پرامپت متنی، کلیپهای ویدیویی تا سقف ۲۰ ثانیه همراه با صدای هماهنگ تولید کند. علاوهبراین، معماری پایه این مدل بهگونهای طراحی شده که قابلیت استفاده در سیستمهای رباتیک و فیزیکی را نیز دارد.
برخلاف رویکردهای رایج که مدلهای مجزای تولید تصویر، ویدیو و صدا را در رابط کاربری خود ارائه میکنند،FLUX 3بهصورت همزمان روی تمام این دادهها آموزش دیده است. این آزمایشگاه آلمانی هدف خود را ارتقای «هوش بصری» (Visual Intelligence) اعلام کرده است؛ مفهومی که محیطهای فیزیکی و دیجیتالی را یکپارچه میبیند.
مدل جدید در قالب چهار محصول ارائه میشود؛ FLUX 3 Video ،FLUX 3 Image ،FLUX 3 Action و نسخه متنباز که FLUX 3 Dev نام دارد. درحالحاضر دسترسی به برنامههای ویدیویی و اکشن تنها از طریق دسترسی زودهنگام محدود امکانپذیر است.
معماری FLUX 3 بر پایه روش اختصاصی این استارتاپ به نام Self-Flow توسعه یافته است. همچنین نسخه متنباز FLUX 3 Dev که قرار است اواخر سال جاری میلادی عرضه شود، برخلاف نسخههای قبلی که فقط به تصویر محدود بودند، یک هسته چندوجهی برای تولید ویدیو، صدا، تصویر و پیشبینی حرکت رباتیک خواهد بود.
عملکرد و بنچمارکهای مدل هوش مصنوعی FLUX 3
در ارزیابیهای اولیه روی ویدیوهای ۱۰ ثانیهای با کیفیت 720p و همراه با صدا، مدل FLUX 3 نتایج قابلتوجهی ثبت کرده است. این مدل در ۹۳ درصد موارد نسبت به Luma Ray 3.2 و در ۷۷ درصد موارد نسبت به Runway Gen-4.5 بهتر ظاهر شده است. همچنین در برابر Kling v3 Pro نرخ برتری ۶۰ درصدی، در برابر Grok Imagine Video نرخ ۶۹ درصدی و در برابر مدل Gemini Omni Flash گوگل نرخ ۵۲ درصدی را کسب کرده است. البته این بنچمارکها دادههای اولیه بوده و براساس نسخههای ارزیابی پیش از عرضه نهایی محاسبه شدهاند.
قابلیتهای ویدیویی FLUX 3 شامل تولید ویدیو از متن، تبدیل تصویر به ویدیو، ویرایش ویدیو به ویدیو، انتقال Keyframe، دیالوگهای چندزبانه و متصلکردن کلیپها برای ساخت ویدیوهای چنددقیقهای با حفظ ثبات شخصیتها است. این ویژگی به یکی از چالشهای اصلی سازندگان محتوا، یعنی حفظ یکپارچگی چهره و هویت شخصیتها در سکانسهای مختلف، پاسخ میدهد.
کاربرد این مدل در حوزه رباتیک نیز با معرفی پروژه FLUX-mimic نمایش داده شده است. با همکاری شرکت سوئیسی Mimic Robotics، این مدل به رباتها کمک میکند تا صحنهها را درک و پیامدهای حرکتی را پیشبینی کنند. به گفته سازندگان، تنظیم دقیق یک ربات برای انجام یک وظیفه جدید به لطف درک فیزیکی موجود در مدل پایه، به جای ۳۰ ساعت به تنها ۳۰ دقیقه داده حرکتی نیاز دارد. استارتاپ Black Forest Labs که هماکنون ۳.۲۵ میلیارد دلار ارزشگذاری شده است، سعی دارد با عرضه وزنهای مدل در آینده، استانداردهای جدیدی را در صنعت هوش مصنوعی پایهگذاری کند.
دوران حرفهای من در دنیای فناوری تقریبا به ۱۰ سال قبل برمیگرده؛ مسیری که با سختافزار شروع شد، با نرمافزار ادامه پیدا کرد و حالا با خبرنگاری حوزه فناوری توی دیجیاتو داره ادامه پیدا میکنه. من جوادم و بیشتر از سه دهه از عمرم میگذره و علاوه بر دنیای فناوری عاشق فیلموسینما، موسیقی کلاسیکراک و رئال مادریدم.
برای گفتگو با کاربرانثبت نامکنید یاوارد حساب کاربریخود شوید.
- قیمت رسمی سری گلکسی واچ ۹ و گلکسی واچ اولترا ۲ مشخص شدقیمت روز پرفروشترین گوشیهای بازار ایران [31 تیر 1405]به لطف تورم به دهه ۷۰ بازگشتیم! | تکتاکچرا همه محاسبات ما به ضرر مردمه؟ | تکتاک