GPT
D

dalle-3-xl-v2

קוד פתוח

ehristoforucreativeml-openrail-m2024-03-09

  • diffusers
  • text-to-image
  • safetensors
  • stable-diffusion
  • lora

מתאם LoRA קל משקל שמנסה לחקות את האסתטיקה של DALL-E 3 על גבי תשתית קיימת. הוא שוקל 441 מגה בייט בלבד ומתחבר ישירות לספריית diffusers.

  • 441 MBמשקל הקבצים
  • 576הורדות בחודש
  • 129לייקים

מה זה

היוצר ehristoforu מציג כאן מתאם LoRA שנועד לתת תוצאות שדומות למראה של DALL-E 3 בלי להחזיק מודל ענק ונפרד. כל החבילה שוקלת 441 מגה בייט ומחולקת לשבעה קבצים בפורמט Safetensors, מה שאומר שלא מורידים כאן מודל בסיס שלם אלא תוספת משקלים קטנה שמתלבשת על מודל קיים דרך ספריית diffusers.

הכרטיס מגדיר את זה כמודל בדיקה, ואין בו נתוני ביצועים, מדידות איכות או פירוט על איזה דאטה הוא אומן. אם המטרה שלכם היא לקבל את הסגנון הגרפי הספציפי שמוכר מהמודל של OpenAI בתוך פייפליין מקומי, זה הכיוון שהוא מנסה לספק בלי לסבך את השרת.

מתאים ל

  • התנסות בסגנון של DALL-E 3

    מאפשר לבדוק אסתטיקה דומה בלי לשלם על כל קריאה ל־API חיצוני.

  • שילוב בפייפליין מקומי

    משקל של 441 מגה בייט שנטען מהר לתוך תשתית diffusers קיימת.

  • בדיקות מהירות בדפדפן

    הדמו ב־Spaces מאפשר לראות את התוצאות בלי לגעת בקוד או להוריד קבצים.

איפה זה נופל

מדובר במודל בדיקה מובהק, וכרטיס המודל כמעט ריק ממידע טכני. אין תיעוד על איזה מודל בסיס הוא מתלבש בדיוק, איך הוא מתמודד עם טקסט בתוך תמונה או עם פרומפטים מורכבים, ואין שום התחייבות ליציבות. מעבר לכך, חובה לכלול את מילת ההפעלה הספציפית בפרומפט כדי לראות השפעה כלשהי.

אותה משפחה

dalle-3-xl יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

זה מודל מלא שמייצר תמונות לבד?

לא, מדובר במשקלי LoRA בלבד. אתם צריכים לטעון אותו מעל מודל בסיס תואם באמצעות diffusers כדי לייצר תמונה בפועל.

איך גורמים למודל להשפיע על התוצאה?

היוצר מציין שחובה להוסיף לפרומפט את הטריגר הייעודי יחד עם משקל של 0.8, אחרת האפקט של המתאם לא יבוא לידי ביטוי.

איך מריצים

טוענים את המשקלים דרך diffusers ישירות לפייפליין תואם, וצריך להגדיר בפרומפט את מילת ההפעלה לפי ההנחיה של היוצר, עם משקל של 0.8. מבחינת חומרה, המשקל של 441 מגה בייט כמעט לא מוסיף עומס על הזיכרון, אבל עדיין תצטרכו כרטיס מסך שיכול להחזיק את מודל הבסיס עצמו.

אם אין לכם כוח להרים שרת ולסדר את הסביבה, היוצר העלה דמו ל־Spaces שאפשר לבדוק בו את התוצאות דרך הדפדפן. שווה לבדוק שם אם הסגנון בכלל עונה על הדרישות שלכם לפני שמתחילים לשלב אותו בקוד.

from diffusers import DiffusionPipeline

pipe = DiffusionPipeline.from_pretrained("ehristoforu/dalle-3-xl-v2")
img = pipe("a photo").images[0]

הקבצים

7 קבצים במאגר, 441 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא creativeml-openrail-m. הוא מאפשר שימוש מסחרי, אבל מטיל מגבלות שימוש שנועדו למנוע פגיעה, תוכן לא חוקי או הפצת מידע כוזב. אם אתם מוציאים מוצר, אתם מחויבים להעביר את אותן המגבלות למשתמשי הקצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • מגבלות שימוש ברישיון

הרישיון המלא בעמוד המודל ↗