GPT
T

ToriiGate-0.5

קוד פתוח

Minthymit2026-04-08

  • safetensors
  • qwen3_5
  • multimodal
  • vision
  • image-text-to-text

מודל ייעודי לתיאור תמונות איור, אנימה וקומיקס, ללא צנזורה ועם זיהוי שמות דמויות. הוא מחליף מודלים כלליים ומסורבלים כשצריך תיוג עמוק ומדויק לאיסוף נתונים או לפרומפטים.

  • 5.2Bפרמטרים
  • 262,144טוקנים בהקשר
  • 9.7 GBמשקל הקבצים
  • 1,348הורדות בחודש

מה זה

מדובר במודל ראייה ושפה שמבוסס על ארכיטקטורת Qwen3_5ForConditionalGeneration, ומכוון ספציפית לעבודה עם אמנות דיגיטלית, צילומי מסך ואיורים. הוא אומן על גרסה מסוננת ומורחבת של מאגר Anime-Art-Multicaptions-v5.0, ולכן הוא מזהה דמויות מוכרות עד סוף שנת 2025, מבדיל בין מאפיינים פיזיים נפרדים של כמה דמויות באותו פריים, ומפיק תיאורים עשירים בלי מילים מכובסות. בניגוד למודלים כלליים שמתחמקים מתיאור תכנים בוטים, הוא מתמודד ישירות עם יצירות sfw וגם nsfw.

בבדיקות של המפתח מול ארבעת אלפים תמונות מאתר Danbooru, המודל הראה יכולת לנחש דמויות פופולריות ללא עזרה, ומסוגל לחלץ שמות מתוך רשימת תגיות כדי לא לבלבל בין דמויות דומות. כמו כן, בבחינה של אלפיים תמונות בקטגוריות בוטות, הערכה סמנטית באמצעות Kimi k2.5 הראתה דיוק תיאורי גבוה יותר לעומת חלופות גדולות יותר, בעיקר בזכות ההיכרות עם ז'רגון התחום.

מתאים ל

  • בניית מאגרי אימון

    יצירת כתוביות מפורטות ומובנות לאלפי איורים כדי לאמן מודלי תמונה חדשים.

  • חילוץ פרומפטים מאיורים

    הפיכת תמונות קיימות לתיאורי טקסט מדויקים שמתאימים מיד כמחרוזת יצירה.

  • מיון וקטלוג גלריות

    זיהוי שמות דמויות ומאפיינים חזותיים בתמונות מרובות לצורך תיוג וחיפוש פנימי.

איפה זה נופל

המודל עבר התאמה כל כך קיצונית למשימת התיאור, שכל היכולות הכלליות שלו בוטלו בכוונה. הוא לא מסוגל לשמש כצ'אט, הוא לא קורא טקסט מתוך תמונה (OCR), הוא נכשל בעיבוד תמונות מרובות במקביל, ואי אפשר לשלוח אליו קלט של טקסט בלבד. המפתח מדגיש שלא לנסות להשתמש בו בממשקים רגילים כמו SillyTavern או OpenWebui.

בנוסף, חלק מתבניות הנימוק עובדות רק אם מעבירים שמות דמויות ידועים מראש, ותמונות עם דמויות נדירות עלולות לגרום לבלבול עם דמויות פופולריות אם לא מספקים תגיות עזר. המודל גם אומן על רזולוציה ממוצעת של מגה פיקסל אחד בערך, ולכן שליחת קבצים ענקיים ללא הקטנה מוקדמת תפגע באיכות.

שאלות
נפוצות

האם המודל מבין ומפיק עברית?

הכרטיס מגדיר את שפת המודל כאנגלית בלבד. הוא לא תוכנן לשיחה או לקריאת טקסטים בעברית, ולכן יש לעבוד מולו באנגלית.

האם אפשר להשתמש בו לשיחה כללית או לתמלול מסמכים?

לא. היכולות של צ'אט, שיחה מרובת שלבים, זיהוי תווים וקלט טקסט בלבד נוטרלו כדי למקד את הביצועים בתיאור ויזואלי.

האם הוא דורש הנחיות מיוחדות כדי לתאר תוכן גרפי או מיני?

לא נדרשות פריצות אבטחה או התחכמויות. המודל אומן מראש ללא צנזורה ומספק תיאורים ישירים ומפורטים של הפעולות בתמונה.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.7 GB, כך שכרטיס מסך ביתי מודרני ממוצע יכול להריץ אותו מקומית. כדי לקבל ביצועים סבירים בפועל עדיף להשתמש במנועים כמו VLLM, Llamacpp או Exllama, כי הרצה ישירה דרך ספריית Transformers איטית מאוד לפי עדות המפתח. קיימות גם גרסאות מכומתות בקהילה וצמתי ComfyUI מוכנים.

אם יש לכם מחשב עם מאיץ גרפי מתאים, שווה להריץ הכל אצלכם כדי לשמור על פרטיות ולעבד אלפי קבצים ברצף ללא תשלום על כל שאילתה. אין למודל הזה שירות ענן רשמי בתשלום לפי קריאה, כך שהברירה היא הרצה עצמית במחשב המקומי או הרמה שלו על שרת ייעודי משלכם.

pip install -U huggingface_hub
hf download Minthy/ToriiGate-0.5

הרישיון

המודל מופץ תחת רישיון mit. זהו רישיון קוד פתוח מתירני מאוד, שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה מחדש ושילוב בתוך מוצרים סגורים, בלי דרישה לחלוק את הקוד שלכם. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗