GPT
F

FlashVSR

קוד פתוח

JunhaoZhuangapache-2.02025-10-11

  • flashvsr
  • video-to-video

הגדלת וידאו בעזרת מודלי דיפיוז'ן סבלה מאיטיות כבדה, והפרויקט הזה מציע ריצה בזמן אמת של כמעט 17 פריימים בשנייה. מי שצריך שיפור איכות לווידאו ארוך בלי לחכות שעות ימצא כאן פתרון יעיל.

  • 6.5 GBמשקל הקבצים
  • 1,907הורדות בחודש
  • 196לייקים

מה זה

הארכיטקטורה מבצעת super-resolution של וידאו מבוסס דיפיוז'ן בצעד יחיד ובמבנה של סטרימינג, במקום תהליכי דגימה איטרטיביים שגוזלים דקות ארוכות לכל קטע קצר. כדי להגיע למהירות הזו, החוקרים זיקקו את המודל בשלושה שלבים, הוסיפו מפענח קטן ומותנה, ונעזרו במנגנון קשב דליל ומקומי שחותך חישובים מיותרים ומגשר על פערי הרזולוציה בין האימון למבחן.

בבדיקות המפתחים, השילוב הזה מפיק קצב של כ־17 פריימים בשנייה ברזולוציה של 768 על 1408 על גבי כרטיס A100 יחיד, נתון שמציג האצה של עד פי 12 ביחס למודלי צעד יחיד קודמים. האימון התבסס על סט נתונים רחב של 120 אלף סרטונים ו־180 אלף תמונות, והוא מתוכנן במיוחד להגדלה ביחס של פי 4 תוך שמירה על מבנים עדינים ומניעת עיוותי טקסטורה.

מתאים ל

  • הגדלת וידאו פי 4 בסטרימינג

    שדרוג סרטונים ישנים בזמן אמת כמעט מלא של 17 פריימים בשנייה על חומרת A100.

  • שחזור פרטים בקטעים ארוכים

    שימוש בסקריפט הייעודי לווידאו ארוך כדי לשמור על עקביות ומבנה ללא עיוותי תנועה.

  • עיבוד אצווה על שרתי ענן

    האצה של עד פי 12 ביחס למודלי דיפיוז'ן קודמים שמאפשרת חיתוך עלויות תשתית בקנה מידה גדול.

איפה זה נופל

המערכת מותאמת באופן כמעט בלעדי להגדלה של פי 4, ובכל יחס אחר התוצאות והיציבות נפגעות משמעותית. מעבר לזה, התלות בספריית הקשב הדליל יוצרת בעיות תאימות חמורות. הביצועים על כרטיסים צרכניים כמו סדרות RTX 40 ו־50 כלל אינם ידועים, ועל H200 ההאצה מוגבלת בגלל תזמון החומרה. יישומי צד שלישי כמו תוספים מוקדמים ל־ComfyUI שניסו להחליף את המנגנון בקשב רגיל סבלו מעיוותי תמונה ומריחות, כך שאי אפשר לוותר על הרכיב הייעודי בלי לשלם באיכות או במהירות.

אותה משפחה

FlashVSR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס ביתי כמו RTX 4090?

הכרטיס הרשמי לא בדק כרטיסים ביתיים אלא רק מעבדי A100, A800 ו־H200. ההידור של Block-Sparse Attention עלול להיכשל או לרוץ ללא האצה על חומרה שאינה מותאמת.

באיזו גרסת משקלים כדאי להתחיל?

מומלץ להוריד את גרסה 1.1 שיצאה בנובמבר 2025. לפי המפתחים היא כוללת שיפורים בנאמנות לתמונה המקורית וביציבות הריצה ביחס לגרסה הראשונה.

איך מריצים

כדי להריץ את המודל מקומית צריך סביבת Python 3.11.13 והידור עצמאי של ספריית Block-Sparse Attention מבית MIT. תהליך הבנייה של הספרייה דורש זיכרון עבודה גבוה כדי למנוע קריסות OOM בזמן ההידור, אך הריצה עצמה יציבה. מבחינת כרטיסי מסך, התשתית נבדקה ועובדת באופן מואץ על NVIDIA A100 ו־A800, ונתמכת גם ב־H200 אך עם תועלת האצה מוגבלת.

קיימות שתי גרסאות משקלים, גרסה 1 המקורית וגרסה 1.1 המומלצת שמספקת יציבות ונאמנות משופרות, לצד סקריפטים נפרדים לווידאו באורך מלא, גרסה קלה או וידאו ארוך. אם אין ברשותכם חומרת שרת תואמת של Ampere או Hopper, הקימפול וההרצה יהיו הימור, ועדיף להמתין לעיבוד מבוסס שירות ענן.

pip install -U huggingface_hub
hf download JunhaoZhuang/FlashVSR

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמתיר שימוש מסחרי חופשי, שינוי הקוד והפצה מחדש. התנאים מחייבים שמירה על הודעות זכויות היוצרים והצהרה על שינויים שבוצעו בקוד המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗