GPT
P

PiD

קוד פתוח

nvidiaרישיון לא דווח2026-04-28

  • pytorch
  • diffusers
  • safetensors
  • super-resolution
  • diffusion

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מפענח שמחליף את ה־VAE המסורתי ומייצר תמונות ברזולוציית 2K עד 4K ישירות מהמרחב הלטנטי. הוא רלוונטי למי שרוצה לשדרג איכות פלט של מודלים קיימים כמו FLUX ו־SDXL.

  • 50.7 GBמשקל הקבצים
  • 220הורדות בחודש
  • 407לייקים

מה זה

במקום להסתמך על מפענח VAE רגיל ואז להריץ מודל הגדלה נפרד, PiD מגדיר את שלב הפענוח כמודל דיפוזיה במרחב הפיקסלים. הוא מקבל את המרחב הלטנטי של מודל הבסיס ויוצר תמונה מוגדלת ונקייה בריצה אחת, תוך דילוג על צוואר הבקבוק המטושטש של שחזור פיקסלים סטנדרטי.

המשקלים מגיעים בגרסאות מזוקקות של 4 צעדים, מה שמקצר את זמן הדיפוזיה ברזולוציות גבוהות. המאגר מכיל התאמות למגוון ארכיטקטורות, כולל משפחת FLUX, SDXL, SD3 ו־Qwen-Image, כך שהוא עובד ישירות מול המרחב הלטנטי שלהן ולא מוגבל למודל יחיד.

מתאים ל

  • שדרוג פלט של FLUX ל־4K

    פענוח ישיר של לטנטים ל־4K ב־4 צעדי דילול בלבד, ללא צורך במודל הגדלה חיצוני.

  • החלפת VAE ב־SDXL

    הפקת תמונות ברורות יותר וברזולוציה גבוהה ישירות מתוך מרחב הלטנטים המקורי.

  • מחקר על שחזור פיקסלים

    בדיקת שיטות דיפוזיה ישירות במרחב הפיקסלים מול מודלי בסיס כמו DINOv2 ו־SigLIP.

איפה זה נופל

גרסת 1.5 מתקנת עיוותי רשת בפינות התמונה ומשפרת נאמנות צבעים ופרטי פנים, אך השיפורים האלה זמינים בעיקר ל־FLUX ו־Qwen-Image. משתמשי SD3 ו־SDXL נשארים עם משקלי 2kto4k הישנים יותר, מה שעלול להשאיר ארטיפקטים בפינות או דיוק צבע נמוך יותר.

שאלות
נפוצות

האם צריך להוריד את כל 50 הג'יגה-בייט?

לא. המאגר מכיל משקלים עבור שורה ארוכה של מודלים שונים כמו FLUX, SD3 ו־SigLIP. מספיק למשוך רק את התיקייה הספציפית שמתאימה למודל שבו אתם משתמשים בפועל.

האם המודל יודע לייצר תמונה מטקסט בעצמו?

לא, זהו מפענח בלבד. תפקידו לקחת את הייצוג הלטנטי שמודל אחר ייצר, כמו FLUX או SDXL, ולהמיר אותו לתמונה ברזולוציה גבוהה.

אפשר לשלב אותו במוצר מסחרי?

לא. הרישיון המוגדר הוא NSCLv1 ומגביל את השימוש למחקר והערכה בלבד, כך שלא ניתן להשתמש בו ליישומים מסחריים.

איך מריצים

המאגר כולו שוקל 50.7 ג'יגה-בייט, אבל אין צורך להוריד את כולו. כל צ'קפוינט שמור כקובץ יחיד בפורמט bfloat16, כך שמורידים רק את המשקלים של מודל המקור הרלוונטי ואת ה־VAE שלו דרך סקריפט הייעודי.

ריצה של דיפוזיה ברזולוציות של 2048 עד 4096 פיקסלים ב־PyTorch דורשת כרטיס מסך חזק עם זיכרון וידאו משמעותי, במיוחד כשהיא רצה לצד מודל הבסיס שמייצר את הלטנטים.

pip install -U huggingface_hub
hf download nvidia/PiD

הקבצים

31 קבצים במאגר, 50.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר תחת רישיון NSCLv1 של אנבידיה. הרישיון מתיר שימוש למטרות מחקר והערכה בלבד, ואוסר שימוש מסחרי מכל סוג במודל או בתוצרים נגזרים שלו.

הרישיון המלא בעמוד המודל ↗