GPT
D

dalle-3-xl-lora-v2

רץ בדפדפן

ehristoforumit2024-03-09

  • gradio

מייצרים תמונות מטקסט בעזרת מודל SDXL שמכוון לסגנון של דאלי. מתאים למי שרוצה לבדוק תוצאות מהירות בלי להוריד משקלים כבדים למחשב.

  • הורדות בחודש
  • 1,792לייקים

מה זה

אתם מקלידים תיאור טקסטואלי של התמונה שאתם רוצים, לוחצים על כפתור ההרצה ומקבלים תמונה שנוצרת במקום. הממשק מאפשר גם להגדיר פרומפט שלילי כדי לסנן אלמנטים לא רצויים, לבחור רוחב וגובה לפי הצורך, לקבוע סיד קבוע או אקראי, ולכוונן את ערך ה־guidance scale שקובע עד כמה התמונה תהיה צמודה לטקסט.

מאחורי הקלעים רץ שילוב של מודלים בתוך תשתית diffusers. הקוד טוען את Fluently-XL-Final יחד עם משקולות של ehristoforu/dalle-3-xl-v2 באמצעות מתזמן מסוג EulerAncestralDiscreteScheduler. זה ניסיון להביא את האסתטיקה והקומפוזיציה המוכרות של DALL-E 3 לתוך ארכיטקטורת קוד פתוח של Stable Diffusion XL, בלי התלות בממשקים סגורים.

הממשק מכיל גם גלריית דוגמאות מוכנות מראש. הדוגמאות האלה מאפשרות לטעון בלחיצה אחת תיאורים קיימים כדי לראות מיד לאיזה סגנון גרפי המודל מכוון ואיך הוא מתמודד עם פירוט מורכב.

מתאים ל

  • יצירת איורים לבלוגים

    מפיקים תמונות מותאמות אישית לפי תיאור טקסט חופשי בלי צורך במנוי לשירותי יצירת תמונות בתשלום.

  • בדיקת פרומפטים בסגנון מוגדר

    בוחנים איך ניסוחי טקסט שונים מגיבים למודל שמכוון לאסתטיקה הדומה לזו של DALL-E 3.

  • התאמת ממדים לתמונות קונספט

    מגדירים יחסי גובה ורוחב שונים בתפריט המתקדם כדי לייצר סקיצות מהירות לכרזות או לאתרים.

איפה זה נופל

השם כולל את המותג DALLE 3, אבל זה לא המודל המקורי של OpenAI אלא עיבוד SDXL שמנסה לחקות את הסגנון שלו. מי שמצפה להבנת שפה עמוקה, טיפול מושלם בטקסט בתוך תמונה או דיוק בפרטים זעירים כמו במקור, יגלה מהר מאוד את המגבלות של קוד פתוח. דוגמאות ההרצה אינן נשמרות במטמון מראש לפי הקוד, כך שכל בדיקה דורשת יצירה חדשה מאפס. בנוסף, לא מצוין תמיכה בעברית בקוד, ולכן ניסוח פקודות בעברית עלול להניב תוצאות שגויות.

אותה משפחה

dalle-3-xl-lora יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא, הגישה בדפדפן חופשית לחלוטין ואינה דורשת תשלום. כל אחד יכול להזין תיאור ולקבל תמונה ישירות מהחומרה המוקצית. אם תבחרו לשכפל את הקוד לחשבון פרטי, ייתכנו עלויות חומרה בהתאם להגדרות שתבחרו.

במה הכלי הזה שונה מ־DALL-E 3 המקורי?

זהו אינו המודל של חברת OpenAI, אלא שילוב בין Fluently-XL לתוסף ייעודי שנועד לחקות את המראה שלו. יכולות פענוח השפה וההיצמדות להוראות מורכבות מבוססות על SDXL, ולכן הן שונות מהמקור המסחרי. הממשק מספק חלופה פתוחה אך התוצאות מגיעות ממנוע אחר לגמרי.

כמה זמן לוקח לכל תמונה להיווצר?

תהליך היצירה נמשך בדרך כלל שניות ספורות בזכות כרטיס המסך A10G שמקצה המערכת. עם זאת, אם ישנם משתמשים רבים באותו רגע, ייתכן שתמתינו בתור משותף קצר לפני שההרצה תתחיל. מד ההתקדמות בממשק מציג את קצב החישוב בזמן אמת.

האם אפשר להריץ את המערכת הזו על המחשב האישי?

כן, הקוד בנוי על ספריות סטנדרטיות של diffusers ומשתמש במודלים ציבוריים. כדי להריץ אותם מקומית תצטרכו כרטיס מסך בעל זיכרון עבודה מספק עבור SDXL. ניתן לשכפל את המאגר ולהוריד את המשקלים באופן עצמאי.

איך משתמשים

נכנסים לממשק, כותבים את הפרומפט בשדה הטקסט ולוחצים על Run. מי שרוצה שליטה עמוקה יותר יכול לפתוח את תפריט האפשרויות המתקדמות ולשנות את הממדים או את הסיד. אין צורך בהתחברות או ביצירת חשבון כדי להתחיל לעבוד.

העיבוד מתבצע על גבי מעבד גרפי מדגם A10G דרך תשתית ZeroGPU של האתר. חומרת הרצה כזו מייצרת תמונות SDXL תוך שניות בודדות, אך מאחר שמדובר במשאב משותף, ייתכן שתיתקלו בהמתנה קצרה בתור כשיש עומס משתמשים. יש גם כפתור שכפול למי שמעדיף להעתיק את האפליקציה לחשבון האישי שלו.

הרישיון

האפליקציה מפורסמת תחת רישיון MIT. הרישיון הזה מתיר שימוש חופשי בקוד, כולל עריכה, הפצה והרצה מסחרית ללא עלות. לגבי התמונות שנוצרות, הזכויות תלויות ברישיונות של מודלי הבסיס Fluently-XL-Final וההרחבה, ולכן מומלץ לבדוק את תנאי השימוש שלהם לפני שימוש מסחרי בתוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗