GPT
F

FlashVSR-v1.1

קוד פתוח

JunhaoZhuangapache-2.02025-10-31

  • flashvsr
  • video-to-video

הגדלת וידאו מבוססת דיפיוז'ן בצעד יחיד ובזמן אמת כמעט. מיועד למי שצריך לשדרג וידאו פי ארבעה ברצף ובמהירות בלי לחכות דקות לכל פריים.

  • 6.5 GBמשקל הקבצים
  • 8,494הורדות בחודש
  • 168לייקים

מה זה

המודל מבצע סופר רזולוציה לווידאו ברמת פי ארבעה, בתהליך הזרמה שמבוסס על מודל דיפיוז'ן של צעד אחד. הרעיון המרכזי כאן הוא שילוב של זיקוק בשלושה שלבים, מפענח מותנה קטן, ותשומת לב דלילה מוגבלת מקומית שמונעת חישובים מיותרים ומגשרת על הפער בין הרזולוציה באימון לזו שבזמן הריצה. גרסה 1.1 מביאה שיפור ביציבות ובדיוק השחזור לעומת הגרסה הראשונה.

מבחינת ביצועים, הוא מגיע לקצב של כ־17 פריימים בשנייה ברזולוציה של 768 על 1408 על גבי כרטיס A100 בודד, מהירות שגבוהה עד פי 12 ממודלים מקבילים של צעד יחיד. המשמעות בפועל היא שאפשר להריץ שדרוג וידאו ברצף כמעט חי, בלי לייצר צוואר בקבוק בלתי נסבל של שעות עיבוד, כל עוד שומרים על יחס ההגדלה המומלץ ולא חורגים ממנו.

מתאים ל

  • השבחת וידאו בסטרימינג

    קצב של כ־17 פריימים בשנייה על A100 מתאים לעיבוד רציף כמעט בזמן אמת.

  • הגדלת ארכיונים פי ארבעה

    שחזור פרטים ואיכות טובה בחומרים ישנים ללא ארטיפקטים של ריצוד.

  • פייפליין עיבוד וידאו בענן

    שילוב בשרתי A100 יעודיים שבהם ספריית הבלוק ספארס מספקת תפוקה מקסימלית.

איפה זה נופל

הוא מתוכנן ומוטב אך ורק להגדלה של פי ארבעה, וכל יחס אחר יפגע בתוצאות. בנוסף, יש תלות קריטית בספריית הקשב הדליל. מי שמנסה להריץ אותו במימושים צד שלישי כמו גרסאות ישנות של ComfyUI שעוברות לקשב צפוף רגיל, יחטוף ירידה חדה באיכות, טשטוש מבנים עדינים וארטיפקטים קשים ברזולוציות גבוהות. מעבר לזה, חוסר הוודאות לגבי ביצועים על כרטיסי מסך שאינם A100 הופך שילוב שלו במחשבי קצה להימור.

אותה משפחה

FlashVSR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס ביתי כמו RTX 4090?

היוצרים מציינים שהתאימות והביצועים בכרטיסי RTX אינם ידועים. המודל תלוי בספריית Block-Sparse Attention שנבדקה ומאיצה היטב רק בארכיטקטורת Ampere בשרתי A100 ו־A800, לכן על כרטיס ביתי תיתקלו בבעיות הידור או באובדן מהירות ניכר.

למה התוצאה ב־ComfyUI נראית פחות טוב מההדגמות?

מימושים מוקדמים של צד שלישי לא כללו את מנגנון הקשב הדליל הייעודי ועברו לקשב רגיל. המעבר הזה מייצר עיוותים ופוגם בפרטים הקטנים ברזולוציות גבוהות, ולכן חובה להשתמש במימוש הרשמי שתומך ברכיב זה.

איך מריצים

כדי להריץ אותו צריך סביבת פייתון 3.11.13, הורדת משקלים דרך Git LFS, והידור של ספריית Block-Sparse Attention. שלב ההידור דורש הרבה זיכרון עבודה כדי לא להתרסק בעומס של נינג'ה, אבל בזמן ריצה צריכת הזיכרון מתייצבת.

ההאצה נבדקה ועובדת באופן אידיאלי רק על מעבדי A100 ו־A800 של אנבידיה. על H200 המודל רץ אבל ההאצה מוגבלת בגלל תזמון חומרה, והתאימות לכרטיסים ביתיים כמו סדרות RTX 40 ו־50 פשוט לא ידועה, כך שאם אין לכם שרת ייעודי תצטרכו להסתמך על תשתית ענן מותאמת.

pip install -U huggingface_hub
hf download JunhaoZhuang/FlashVSR-v1.1

הרישיון

הפרויקט מופץ ברישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו מחדש בתוך מוצר סגור, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי ומציינים שינויים שנעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗