GPT
A

AuraSR

קוד פתוח

falcc2024-06-25

  • transformers
  • safetensors
  • art
  • pytorch
  • super-resolution

מגדיל תמונות שנוצרו במודלים אחרים פי ארבעה, בלי להסתבך עם זמני ריצה ארוכים של דיפיוז'ן. הוא מבוסס על גישת GAN מהירה במיוחד לתמונות קטנות.

  • 618Mפרמטרים
  • 4.6 GBמשקל הקבצים
  • 140הורדות בחודש
  • 308לייקים

מה זה

מדובר במודל סופר-רזולוציה מבוסס GAN, שמממש וריאציה של ארכיטקטורת GigaGAN לפי הקוד הפתוח של lucidrains. המטרה שלו ממוקדת מאוד, לקחת תמונות שנוצרו בבינה מלאכותית, לרוב כאלה שיוצאות מטושטשות או חסרות פרטים ברזולוציה בסיסית, ולהקפיץ אותן ברזולוציה פי 4.

בניגוד למודלי דיפיוז'ן כבדים שלוקחים שניות ארוכות לכל הגדלה, רשתות GAN עושות את המעבר הזה בריצה ישירה ומהירה בהרבה. עם כ־618 מיליון פרמטרים, הוא תופס משבצת קלה יחסית שלא דורשת חוות שרתים מפלצתית כדי להוציא תוצאה חדה מתמונת מקור של 256 על 256 פיקסלים.

מתאים ל

  • הגדלת פלטים של מודלי תמונה

    לוקח תמונות קטנות שיצרתם במודל בסיסי ומקפיץ אותן פי 4 ברזולוציה במהירות של GAN.

  • חידוד ארטיפקטים ברינדור

    מתאים לניקוי טשטושים בתמונות סינתטיות לפני שמציגים אותן למשתמשי קצה.

  • פייפליין מקומי זול בזיכרון

    רץ על כרטיסי מסך סטנדרטיים של 8 גיגה בזכות משקל קבצים של 4.6 גיגה בלבד.

איפה זה נופל

כרטיס המודל לא מציג מדדי איכות רשמיים, מבחני ביצועים או זמני ריצה בשניות, וזה משהו שחייבים לבדוק לבד לפני שרצים איתו קדימה. ארכיטקטורות GAN נוטות לעיתים לייצר עיוותים לא נעימים או מריחות מוזרות כשמזינים להן תמונות שונות מאוד מאלה שעליהן אומנו, במיוחד פרצופים או טקסט קטן. בנוסף, הוא מיועד ספציפית להגדלת תמונות שנוצרו במחשב, כך שלא בטוח איך הוא יתמודד עם צילומים אמיתיים עם רעש מצלמה טבעי.

אותה משפחה

AuraSR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לתמונות רגילות מהטלפון?

המודל מוגדר במפורש לטיפול בתמונות שנוצרו במחשב ולא בצילומים מהעולם האמיתי. אפשר טכנית להריץ עליו כל תמונה, אבל התוצאה בצילומים טבעיים עלולה להיראות פלסטית או מלאכותית בגלל האופי של רשתות GigaGAN.

במה הוא שונה ממודלי אפסקייל מבוססי דיפיוז'ן?

הוא עובד בארכיטקטורת GAN שמעבדת את התמונה במעבר אחד ולא בעשרות צעדי דגימה. זה אומר שהוא מפיק תוצאה כמעט מיידית, אבל לפעמים מפספס עקביות בפרטים מורכבים מאוד בהשוואה למודלים איטיים יותר.

איך מריצים

כדי להריץ אותו מתקינים את חבילת aura-sr בפייתון וטוענים את המשקלים דרך הקוד הייעודי. הקבצים שוקלים 4.6 גיגה-בייט, כך שכרטיס מסך מודרני עם 8 עד 12 גיגה זיכרון יחזיק אותו בלי בעיה לצד שאר התהליך שלכם.

אם אתם כבר מייצרים תמונות על שרת מקומי, אפשר לשרשר אותו מיד בסוף הפייפליין של הרינדור. לעומת זאת, אם האפליקציה שלכם רק קוראת ל־API חיצוני כדי לייצר תמונות, עדיף להשאיר גם את ההגדלה אצל ספק ענן ולא להחזיק שרת GPU שלם רק בשביל המודל הזה.

from transformers import pipeline

pipe = pipeline("text-generation", model="fal/AuraSR")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 4.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הרשום בעמוד הוא cc כללי בלבד, בלי לציין את הגרסה המדויקת כמו CC-BY או CC-BY-NC. זה מצב בעייתי לחברות מסחריות, כי אי אפשר לדעת בוודאות אם מותר לשלב אותו במוצר שמכניס כסף או מה דרישות הקרדיט, וצריך לבדוק במאגר המקורי לפני שמשחררים קוד ללקוחות.

הרישיון המלא בעמוד המודל ↗