GPT
S

SD3.5-with-Captioner

רץ בדפדפן

gokaygokayapache-2.02024-09-07

  • gradio

הממשק מאפשר לייצר תמונות באמצעות תיאור טקסטואלי או על בסיס תמונה קיימת, תוך שילוב מודלים שמרחיבים ומעבדים את הפרומפט. הוא מתאים למי שרוצה לבדוק שילובי פרומפטים לפני הפקה מקומית.

  • הורדות בחודש
  • 77לייקים

מה זה

אתם מעלים תמונה כדי לקבל ממנה תיאור אוטומטי, או כותבים פרומפט טקסטואלי ישירות בממשק. בתמורה מקבלים תמונה חדשה שנוצרת ברזולוציה שנקבעה, לצד מספר הסיד המדויק ששימש את המערכת.

מאחורי הקלעים רץ שילוב של כמה מודלים. ניתוח התמונות נעשה בעזרת Florence-2-base, והרחבת הניסוח מתבצעת על ידי Lamini-Prompt-Enchance-Long או דרך מודלי שפה חיצוניים כמו Qwen2.5-72B, Mixtral, Mistral ו־Llama-3.1-70B. יצירת התמונה הסופית מתבצעת דרך Stable Diffusion 3.5 Large, יחד עם שימוש בקובצי הטורבו של המודל לפי הגדרות הצינור.

מתאים ל

  • שחזור תמונה בסגנון שונה

    מעלים תמונה קיימת, Florence-2 מחלץ ממנה תיאור מלא, ומודל התמונה מייצר גרסה חדשה לחלוטין לפי הטקסט.

  • בדיקת פרומפטים מורחבים

    מזינים משפט בסיסי, נותנים למודל השפה להרחיב אותו, ורואים איך הפירוט הנוסף משפיע על התוצר הוויזואלי.

  • הפקת תמונות ב־SD 3.5

    שליטה ידנית על ממדי התמונה, כמות צעדי הריצה ומשקל ההנחיה לצורך בדיקת מודל הדיפוזיה ישירות מהדפדפן.

איפה זה נופל

אם אתם מעלים תמונה וגם כותבים טקסט, הממשק מתעלם מהטקסט שלכם ומשתמש בתיאור שחולץ מהתמונה בלבד, כי הטקסט מוגדר לפעול רק בהיעדר תמונה. שרשור המודלים גם מסתיר את היכולת האמיתית של מודל התמונה הגולמי, כי הפרומפט משוכתב לפני ההפקה. נוסף לכך, עומס על חומרת השרת השיתופית גורם לעיתים לתורים או להפסקת ריצה באמצע התהליך.

שאלות
נפוצות

האם השימוש בממשק עולה כסף?

לא, הממשק פתוח לשימוש חופשי בדפדפן דרך Hugging Face Spaces. אין צורך לשלם על הגישה או להזין פרטי אשראי כדי להריץ בדיקות. עם זאת, זמינות החומרה תלויה בעומס הכללי על השרתים באותו רגע.

במה הממשק הזה שונה מהרצת SD 3.5 רגיל?

הוא לא מריץ רק את מודל התמונות אלא מחבר אליו שרשרת עיבוד שלמה. יש כאן מודל ראייה שמפענח תמונות ומודלי שפה שמרחיבים את הפרומפטים לפני שהם מגיעים למודל הדיפוזיה עצמו. זה משנה את התוצאה לעומת פנייה ישירה למודל.

האם אפשר להריץ את כל הקוד מקומית במחשב?

הקוד פתוח תחת רישיון Apache 2.0 וכולל קובץ app.py סטנדרטי של Gradio. עם זאת, כדי להריץ מקומית את SD 3.5 Large יחד עם Florence-2 ומודלי שפה גדולים, תצטרכו מחשב עם כרטיס מסך חזק מאוד וזיכרון וידאו משמעותי.

מה קורה עם התמונות והטקסט שמעלים לממשק?

המידע מעובד על גבי שרתי הענן שמקצים את חומרת ה־A10G לטובת הממשק. הנתונים משמשים להרצת הצינור הנוכחי שלכם באותו הרגע ואינם מוגדרים בממשק לשמירה במאגר פומבי. למרות זאת, לא מומלץ להעלות מידע רגיש לשרתים שיתופיים פתוחים.

איך משתמשים

טוענים תמונה לחלון הקלט או מקלידים תיאור, בוחרים אם להפעיל את מרחיב הפרומפטים או את מודל השפה, ולוחצים על כפתור ההפקה. הממשק כולל שליטה על מידות, מספר צעדי ריצה בין 1 ל־50 וערך ה־guidance scale.

הקוד רץ על חומרת zero-a10g שמשתמשת במודול spaces. החומרה מוקצית בזמן אמת, ולכן תהליך יצירת תמונה עם 40 צעדים לוקח זמן מורגש, בייחוד כשמופעלים קודם מודלי השפה או הראייה הממוחשבת.

הרישיון

הפרויקט עצמו מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי קוד. עם זאת, התוצרים והתמונות שמעלים כפופים לתנאי הרישיון הספציפיים של המודלים המופעלים, כולל מגבלות השימוש של משפחת Stable Diffusion 3.5 ומודלי השפה של מטא, מיסטרל ומיקרוסופט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗