GPT
L

ldm-super-resolution-4x-openimages

קוד פתוח

CompVisapache-2.02022-11-09

  • diffusers
  • pytorch
  • super-resolution
  • diffusion-super-resolution

הגדלת תמונות פי ארבעה באמצעות דיפוזיה במרחב הלטנטי, במקום עיבוד ישיר על הפיקסלים. מתאים למי שרוצה חדות של מודלי דיפוזיה בלי לשרוף שעות חישוב יקרות.

  • 1.3 GBמשקל הקבצים
  • 594הורדות בחודש
  • 128לייקים

מה זה

מדובר במודל שמשחזר ומגדיל תמונות פי ארבעה על בסיס ארכיטקטורת Latent Diffusion Models שאומנה על מאגר OpenImages. הרעיון המרכזי כאן הוא ביצוע תהליך הסרת הרעש בתוך מרחב ייצוג דחוס של אוטואנקודר שהוקפא מראש, ולא ישירות על מרחב הפיקסלים הגולמי. הגישה הזו חותכת את כוח החישוב הנדרש בהשוואה למודלי דיפוזיה רגילים, ועדיין מצליחה להוסיף פרטים משכנעים לתמונה המוגדלת.

הכרטיס מציג ארכיטקטורה שכוללת שכבות cross-attention ומאפשרת פעולה בצורה קונבולוציונית כדי להגיע לרזולוציות גבוהות. בניגוד לשיטות אינטרפולציה קלאסיות שרק מטשטשות או מנחשות מעברים חלקים, המודל מסנתז טקסטורות יש מאין על סמך מה שלמד על תמונות כלליות.

מתאים ל

  • שחזור תמונות ישנות

    הגדלת תמונות מטושטשות פי ארבעה תוך סינתזה של פרטים חסרים.

  • הכנת תמונות לדפוס

    העלאת רזולוציה לקבצים שצריכים להיראות חדים בגודל מלא.

  • הגדלת תוצרי מודלי תמונה

    השבחת פלטים של מודלי מחוללי תמונות שנוצרו ברזולוציה נמוכה.

איפה זה נופל

מודלי דיפוזיה נוטים להמציא פרטים שלא היו קיימים במקור, מה שיכול לייצר עיוותים לא נעימים בטקסטים קטנים, במסמכים או בתווי פנים עדינים. האימון נעשה על OpenImages, כך שהוא מכיר היטב אובייקטים וסצנות מהעולם האמיתי, אבל עלול לזייף באיורים, בצילומי מסך או בדיאגרמות טכניות. יש לבדוק היטב אם ההזיות הגרפיות שלו מקובלות על המוצר שלכם לפני שמעבירים דרכו תמונות קריטיות.

שאלות
נפוצות

האם המודל מהיר מספיק לזמן אמת?

לא. למרות שהחישוב במרחב הלטנטי מקצר זמנים יחסית לדיפוזיה רגילה, הוא דורש מספר צעדי הסרת רעש. לזמן אמת עדיף להשתמש ברשתות קונבולוציה מהירות ולא בדיפוזיה.

איך משלבים אותו בקוד?

הוא נתמך ישירות בספריית diffusers. טוענים את הצינור המתאים מתוך המאגר ומעבירים אליו את התמונה בקריאה פשוטה.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 גיגה בייט בפורמט שמתאים ישירות לספריית diffusers של פייתון. מדובר בגודל נוח שלא דורש כרטיס מסך מפלצתי, וכל מעבד גרפי מודרני עם זיכרון צנוע יטען אותו בלי מאמץ.

אם אתם צריכים להגדיל אלפי תמונות ביום בזמן אמת, כדאי לקחת בחשבון שפעולת דיפוזיה איטרטיבית עדיין אטית משמעותית מרשתות קונבולוציה פשוטות כמו ESRGAN. במקרה של שירות שדורש שיהוי אפסי, פתרון מבוסס תשתית חיצונית יכול לחסוך תחזוקה.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("CompVis/ldm-super-resolution-4x-openimages")
img = pipe("a photo").images[0]

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש כמעט מוחלט. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗