GPT
N

NAVA

קוד פתוח

baiduapache-2.02026-05-29

  • custom
  • ti2v
  • text-to-video
  • text-to-audio-video
  • audio-video-generation

מייצר וידאו ברזולוציית 720p יחד עם אודיו תואם בריצה אחת. מתאים למי שחייב סנכרון שפתיים ודיבוב רב־דוברים בלי להרכיב מודל קול בנפרד.

  • 43.5 GBמשקל הקבצים
  • 103הורדות בחודש
  • 127לייקים

מה זה

במקום לחבר מודל וידאו קיים עם רצועת קול נפרדת, הכלי הזה מאמן את הווידאו והאודיו יחד על ארכיטקטורת MMDiT שמבוססת על Wan2.2. הוא מייצר מקטעים של שש עד עשר שניות, כולל סאונד סטריאו שמורכב מקולות סביבה ודיבור מתוזמן. השליטה בזהות הקולית מתבצעת דרך קובצי אודיו לדוגמה שמוזרקים ישירות לטקסט, לצד שליטה בתנועת המצלמה דרך התיאור המילולי.

במבחני VerseBench המודל מציג סנכרון קול־תמונה טוב יותר וציון איכות וידאו של 0.659, מעל פתרונות גדולים ממנו כמו MOVA של 32 מיליארד פרמטרים ו־LTX 2.3. גם בבדיקות דיבור המערך הגיע לרמת שגיאות מילים של 5.81 אחוז, נתון קרוב למודלים שמייצרים קול בלבד.

מתאים ל

  • הנפשת דמויות מדברות

    מאפשר לייצר סרטון עם קול מותאם אישית ישירות מתמונת מקור וקובץ שמע של הדובר.

  • סרטוני סושיאל קצרים

    מייצר קליפ של עד עשר שניות בפורמט אנכי או רוחבי עם אפקטי קול של הסביבה בפעימה אחת.

  • דיאלוג של שני דוברים

    תומך בהגדרת שני קולות שונים באמצעות תגיות טקסט, בלי צורך לחתוך ולהדביק אודיו בעריכה.

איפה זה נופל

המודל אומן בעיקר על תיאורים צפופים בסינית, כך שפרומפטים קצרים או פניות באנגלית מניבים תוצאות פחות טובות ומחייבים שלב מקדים של שכתוב טקסט. קובצי האודיו לדוגמה מוגבלים לשני דוברים בלבד בכל קטע, ואורך הסרטון המקסימלי מוגבל לעשר שניות ברצף.

אין תמיכה מובנית בעברית, כך שכל דיבור או תיאור סצנה יחייב בדיקה של התנהגות מקודד הטקסט והפרומפטים. הקוד נשען על מבנה מותאם אישית ותלויות ספציפיות כמו Flash-Attention, מה שמקשה על הטמעה מהירה במערכות מדף.

שאלות
נפוצות

אפשר להשתמש במודל לסרטונים בעברית?

המודל תומך רשמית באנגלית ובסינית בלבד. הוא לא אומן על עברית, ולכן ניסיון לייצר דיבור בעברית בסנכרון שפתיים צפוי להיכשל או להישמע משובש לחלוטין.

חייבים להחזיק שמונה כרטיסי מסך בשביל להריץ אותו?

לא חובה, הקוד תומך גם בהרצה על כרטיס מסך בודד. המחיר יהיה זמני יצירה ארוכים מאוד, מאחר שהתשתית של שמונה כרטיסים נועדה להוריד את זמן הרינדור לכדקה אחת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־43.5 גיגה־בייט, כולל מודל הליבה, מקודד טקסט של 11 גיגה־בייט ורכיבי VAE לווידאו ולאודיו. הרצה של 50 צעדי דגימה דורשת זיכרון וידאו משמעותי, והתשתית המומלצת בסקריפטים של הפרויקט נשענת על שמונה כרטיסי מסך במקביל כדי לייצר סרטון בתוך כדקה. אפשר לרוץ על כרטיס בודד, אבל קצב היצירה צונח בהתאם.

בנוסף למודל עצמו, תהליך העבודה כולל מודל שפה חיצוני קטן בשם Qwen3-4B לצורך שכתוב פרומפטים. אם אין לכם שרת ייעודי עם חומרה ברמת שמונה מאיצים, תתקשו לשלב את זה בפרודקשן מקומי בזמני תגובה סבירים.

pip install -U huggingface_hub
hf download baidu/NAVA

הרישיון

הפרויקט פורסם תחת רישיון Apache-2.0 שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תמלוגים, בכפוף לשמירה על הצהרות זכויות היוצרים. תנאי המודל אוסרים במפורש שימוש בקולות או בפנים של אנשים אמיתיים ללא הסכמתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗