GPT
T

TIPO-500M-ft

קוד פתוח

KBlueLeafother2025-01-10

  • transformers
  • safetensors
  • gguf
  • llama
  • text-generation

מודל שפה קומפקטי שמכוון למשימה אחת בלבד: להרחיב ולשפר פרומפטים קצרים ליצירת תמונות. הוא שוקל פחות משלושה ג'יגה ורץ מקומית בלי לגעת בשרתים חיצוניים.

  • 508Mפרמטרים
  • 2,048טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 55,362הורדות בחודש

מה זה

מדובר במודל מבוסס ארכיטקטורת LLaMA עם 508 מיליון פרמטרים, שעבר אימון ייעודי על מאגרי נתונים של תיאורי תמונות כמו Danbooru, Coyo11M ו־GBC10M. המטרה שלו היא לקחת קלט משתמש קצר או חלקי, ולבצע דגימה מוקדמת שמרחיבה אותו לפרומפט עשיר עבור מודלי יצירת תמונה. גרסת ה־ft הזו ראתה כ־42 מיליארד טוקנים, כולל נתוני Danbooru שעברו עיבוד עם Pixtral, מה שמוסיף לה עוד כ־12 מיליארד טוקנים בהשוואה לגרסת ה־500M הבסיסית.

מבחני הביצועים שפורסמו נערכו אמנם על גרסת ה־200M הקטנה יותר, אבל הם מראים את הכיוון של הסדרה כולה. במבחני שיפור תגיות נוף, המודל עקף את GPT4o-mini במדד FDD ובחוסר פגיעה במבנה התמונה (AI Corrupt), למרות שמבחינת אסתטיקה כללית המודל הגדול של OpenAI עדיין קיבל ציונים מעט גבוהים יותר. המשמעות היא שהמודל יודע להוסיף הקשר ויזואלי בלי להמציא דברים שמחרבים את ההנחיה המקורית.

מתאים ל

  • הרחבת פרומפטים ב־ComfyUI

    מתאים לחיבור מקומי בצינור עבודה ליצירת תמונות, כדי להפוך מילים בודדות לפרומפט מלא בלי לפנות ל־API חיצוני.

  • השלמת תגיות בסגנון אנימה

    האימון על Danbooru הופך אותו למתאים במיוחד ליצירת תגיות מדויקות למודלים שמבוססים על סגנון איור מזרחי.

  • העשרת הנחיות חלקיות

    מצוין למצבים שבהם המשתמש מקליד תיאור קצר מאוד ורוצים להוסיף פרטי רקע וסביבה באופן אוטומטי.

איפה זה נופל

המודל הזה לא מיועד לשיחה, לא יודע לענות על שאלות כלליות, ואין לו שום הבנה בעברית, כל האימון שלו הוא באנגלית בלבד. מעבר לזה, כל מדדי הביצועים שהוצגו בדף נמדדו בפועל על גרסת ה־200M ולא על גרסת ה־500M-ft עצמה, כך שאין שום הוכחה מספרית מתועדת לגבי השיפור המדויק שהגרסה הזו מביאה.

המערכת גם נשענת בכבדות על עולם התיוג של Danbooru, מה שאומר שהיא נוטה לחשיבה בסגנון תגיות אנימה. אם אתם מחפשים תיאורים ריאליסטיים מורכבים בשפה חופשית, צריך לבדוק היטב אם התוצאה לא מושכת לכיוון הזה.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על מאגרי מידע באנגלית בלבד כמו Danbooru ו־Coyo11M, וכל קלט בעברית ייכשל או ייתן תוצאות לא צפויות.

מה ההבדל בין גרסת ה־ft לגרסת ה־500M הרגילה?

גרסת ה־ft אומנה על 42 מיליארד טוקנים לעומת 30 מיליארד בגרסה הרגילה, תוך שימוש בנתוני Danbooru שעובדו מחדש בעזרת Pixtral.

האם כדאי להשתמש בו כמנוע צ'אט כללי?

ממש לא. מדובר במודל שנועד אך ורק להרחבה ושיפור של פרומפטים עבור מודלי תמונה, ואין לו יכולות שיחה או ידע כללי.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.8 ג'יגה בפורמט float32, כך שכל כרטיס מסך ביתי בסיסי עם 4 עד 6 ג'יגה זיכרון מריץ אותו בלי שום בעיה. אפשר להעלות אותו ישירות מספריית transformers, אבל בפועל רוב האנשים ישתמשו בהרחבה z-tipo-extension שמתחברת ישירות לממשקי תמונות כמו ComfyUI או WebUI Forge.

אין שום סיבה לשלם על API או לשלוח בקשות לענן בשביל כלי כזה. היתרון הגדול שלו הוא הריצה המקומית והמיידית, ממש כשלב מוקדם בתוך צינור יצירת התמונה על אותו המחשב.

ollama run hf.co/KBlueLeaf/TIPO-500M-ft:F16

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ומפנה ל־Kohaku License 1.0. זהו רישיון מותאם אישית שדורש בדיקה פרטנית של התנאים שלו מול היוצר לפני כל הפצה או שילוב במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗