GPT
A

AuraFlow-v0.2

קוד פתוח

falapache-2.02024-07-24

  • diffusers
  • safetensors
  • text-to-image

מודל פתוח לגמרי ליצירת תמונות מטקסט שמבוסס על ארכיטקטורת flow. הוא פונה למי שמחפש אלטרנטיבה חופשית בקוד פתוח עם תוצאות חזקות במבחני GenEval.

  • 6.8Bפרמטרים
  • 62.3 GBמשקל הקבצים
  • 570הורדות בחודש
  • 154לייקים

מה זה

הפרויקט הזה מביא מודל text-to-image מבוסס flow בגודל של כמעט שבעה מיליארד פרמטרים. לפי היוצרים שלו, הוא אומן עם יותר כוח חישוב בהשוואה לגרסה הקודמת ומציג ביצועים מובילים במבחן GenEval, מה שאומר בפועל שהוא אמור להתמודד טוב יותר מהממוצע עם הבנה מדויקת של פרומפטים מורכבים ושילוב אלמנטים בתמונה.

השוני העיקרי כאן הוא השילוב בין גודל משמעותי לבין גישה חופשית לגמרי למשקלים. בעוד מודלים מתחרים בגדלים האלה מגיעים לעיתים קרובות תחת מגבלות שימוש או בגרסאות סגורות, כאן כל המשקלים בחוץ ונתמכים ישירות דרך ספריית diffusers המוכרת.

מתאים ל

  • יצירת תמונות ברזולוציה גבוהה

    מתאים לרינדור תמונות של 1024 על 1024 עם רמת פירוט גבוהה מתוך פרומפטים מילוליים עשירים.

  • מחקר ופיתוח על מודלי flow

    משמש בסיס מצוין לחוקרים שרוצים לחקור ארכיטקטורת flow פתוחה לחלוטין בהיקף של שבעה מיליארד פרמטרים.

  • מוצרים מסחריים עצמאיים

    הרישיון המתירני מאפשר להטמיע את המודל ישירות בתשתיות פנימיות בלי תלות ברישיונות סגורים.

איפה זה נופל

היוצרים מגדירים את הגרסה הזו כבטא בלבד, והיא עדיין נמצאת בפיתוח פעיל. מעבר לכך, נפח הקבצים עצום ומקשה מאוד על פריסה מהירה בשרתים רגילים, כך שלא מדובר בכלי שאפשר פשוט לזרוק לתוך מוצר קיים בלי לבדוק לעומק יציבות, זמני תגובה ומשאבי זיכרון.

אותה משפחה

AuraFlow יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ אותו לבד?

המשקלים שוקלים מעל שישים גיגה-בייט ונטענים בפורמט fp16. תצטרכו כרטיס מסך מקצועי עם נפח זיכרון גבוה במיוחד, כמו כרטיסי שרתים ייעודיים, אחרת תקבלו שגיאות זיכרון מיד בטעינה.

האם המודל יציב ומוכן לשימוש במוצר חי?

לא לגמרי. היוצרים מציינים במפורש שהמודל נמצא בסטטוס בטא והעבודה עליו נמשכת, כך שמומלץ לבדוק את איכות הפלטים והעמידות שלו לפני שמבססים עליו שירות קריטי.

איך מריצים

כדי להריץ אותו מקומית תצטרכו את diffusers ישירות מגיטהאב, לצד ספריות תשתית כמו transformers ו־accelerate. הקוד דורש CUDA וטוען את המשקלים בפורמט fp16 באמצעות AuraFlowPipeline, עם תמיכה ביצירת תמונות ברזולוציה של 1024 על 1024 פיקסלים בחמישים צעדי ריצה.

מכיוון שהמשקלים תופסים מעל שישים גיגה-בייט על הדיסק, מדובר במפלצת שדורשת כרטיס מסך חזק מאוד עם זיכרון VRAM נדיב כדי לא להתרסק. אם אין לכם חומרה ייעודית כבדה מקומית, עדיף בהחלט לגשת אליו דרך שירות ענן או API.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("fal/AuraFlow-v0.2")
img = pipe("a photo").images[0]

הרישיון

המודל משוחרר ברישיון apache-2.0. זה אומר שאתם חופשיים לחלוטין להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו גרסאות המשך ולשלב אותו במוצרים שלכם, כל עוד אתם שומרים על הודעת הרישיון המקורית וכתב הוויתור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗