GPT
K

KolorsPlusPlus

רץ בדפדפן

gokaygokayapache-2.02024-07-07

  • gradio

הכלי יוצר תמונות באמצעות שילוב בין מודלי תיאור תמונה, הרחבת פרומפטים ומודל Kolors. הוא מתאים למי שרוצה ליצור וריאציות מתמונה קיימת או להרחיב תיאור טקסטואלי קצר בלי לכתוב הכל לבד.

  • הורדות בחודש
  • 166לייקים

מה זה

הממשק מקבל תמונה להעתקת סגנון או תיאור טקסט חופשי, ופולט בין תמונה אחת לארבע תמונות חדשות, לצד הפרומפט הסופי והסיד ששימשו ליצירה. אם מעלים תמונה, מפעילים עליה מודל ראייה כמו Florence-2-base או PaliGemma בשם sd3-long-captioner-v2 כדי לחלץ ממנה תיאור מילולי מפורט.

על הטקסט הזה, או על טקסט ידני שהכנסתם, אפשר להפעיל מודל הרחבה ייעודי, Lamini-Prompt-Enchance בגרסת מדיום או ארוכה. את התוצאה המעובדת מקבל Kolors, שמשתמש ב־ChatGLM3-6B כאינקודר טקסט ומודל מבוסס SDXL כדי לייצר את התמונה הסופית.

מתאים ל

  • יצירת וריאציות מתמונה

    מעלים תמונה קיימת, מודל הראייה מתאר אותה ומפיק גרסאות חדשות באותו סגנון.

  • הרחבת רעיונות מטקסט קצר

    מקלידים משפט בסיסי ומודל השפה משלים פרטים טכניים ותיאורי תאורה לפני הרינדור.

  • בדיקת איכות של Kolors

    השוואה בין ביצועי מודל Kolors ל־SDXL רגיל על בסיס פרומפטים מורכבים.

איפה זה נופל

הכלי מורכב משרשרת של מספר מודלים נפרדים, מה שאומר שכל שגיאה בתיאור התמונה הראשוני נגררת ומועצמת ישירות לתמונה הסופית. בנוסף, מודל היצירה Kolors ומנוע השפה ChatGLM מכוונים בעיקר לאנגלית ולסינית, כך שפרומפטים בעברית צפויים להניב תוצאות שגויות או לא רלוונטיות. אם אתם מחפשים עריכה מדויקת של אזור מסוים בתמונה, זה לא הכלי המתאים כי הוא מייצר הכל מחדש לפי תיאור כללי.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הגישה דרך הדפדפן חופשית לחלוטין. אין צורך להזין אמצעי תשלום, אך נדרש חשבון באתר אם המרחב דורש הפעלה מחדש.

במה הכלי שונה משימוש ישיר במודל Kolors?

הוא עוטף את המודל בשכבות אוטומטיות של תיאור תמונה והרחבת טקסט. במקום לנסח פרומפט ארוך ומדויק בעצמכם, מודלים כמו Florence-2 ו־Lamini מכינים את הקלט עבור Kolors.

האם אפשר להריץ את המערכת על המחשב?

כן, הקוד מבוסס על ספריות סטנדרטיות כמו diffusers ו־transformers. עם זאת, בגלל ריבוי המודלים הכבדים הפועלים במקביל, תצטרכו כרטיס מסך חזק עם נפח זיכרון משמעותי.

מה קורה לתמונות שאני מעלה לממשק?

התמונות מעובדות ישירות בזיכרון של המופע כדי לחלץ את הטקסט. הן אינן נשמרות במאגר ציבורי קבוע, אך התעבורה עוברת דרך השרת המארח.

איך משתמשים

בוחרים אם להעלות תמונה או להקליד פרומפט תחת ההגדרות המתקדמות, קובעים אם להפעיל משפר פרומפטים, ולוחצים על Generate Image. ברירת המחדל מוגדרת ל־20 צעדי יצירה ברזולוציה של 1024 על 1024 פיקסלים. החומרה מאחורי הקלעים היא מאיץ מסוג zero-a10g, מה שמספק זמני יצירה סבירים, אך המרחב נמצא כרגע במצב שינה, כך שהפעלה ראשונה תדרוש זמן המתנה להעלאת המכונה והמשקלים.

הרישיון

הקוד מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי ושינוי. עם זאת, המערכת משלבת מספר מודלים עצמאיים כמו Kolors ו־ChatGLM, ולכן שימוש מסחרי בתוצרים מחייב בדיקה של תנאי הרישיון של כל רכיב בשרשרת בנפרד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗