GPT
G

GLM-4.6V-Flash-GGUF

קוד פתוח

unslothmit2025-12-09

  • transformers
  • gguf
  • unsloth
  • image-text-to-text
  • zh

גרסת קוונטיזציה של מודל ראייה וטקסט קל יחסית שמתמקד בהפעלת כלים מתוך תמונה. הוא מתאים למי שרוצה לעבד מסמכים או צילומי מסך מקומית בלי לשלוח מידע החוצה.

  • 160 GBמשקל הקבצים
  • 12,888הורדות בחודש
  • 122לייקים

מה זה

מדובר בגרסת GGUF שארזה unsloth עבור GLM-4.6V-Flash, מודל קטן מסדרת GLM-V שכוללת גם גרסת ענק של 106 מיליארד פרמטרים. הדגם הזה תוכנן במקור כגרסה קלה של 9 מיליארד פרמטרים שנועדה לתת זמני תגובה מהירים בהרצה מקומית. הוא יודע לקבל קלט משולב של תמונות וטקסט, לתמוך בחלון הקשר שמגיע עד 128 אלף טוקנים, ולשלב קריאות לפונקציות ישירות מתוך המידע הוויזואלי.

הייחוד שלו לעומת מודלים מקבילים בגודל הזה הוא היכולת לקחת מסמכים ארוכים, תרשימים וצילומי ממשק משתמש, ולתרגם אותם לפעולות או לקוד HTML ו־CSS בלי שלב ביניים של חילוץ טקסט. המפתחים מדווחים על ביצועים מובילים במבחני ראייה ממוחשבת למודלים בסדר גודל דומה, בעיקר סביב ניתוח עמודים עמוסים וייצור תוכן ויזואלי משולב.

מתאים ל

  • המרת צילומי ממשק לקוד

    יצירת שלד HTML ו־CSS מתוך תמונות מסך של עיצובים וביצוע שינויים לפי הוראות.

  • ניתוח מסמכים מורכבים

    פענוח ישיר של דוחות ארוכים הכוללים טבלאות ותרשימים גרפיים ללא חילוץ טקסט ידני.

  • סוכן אוטומציה מבוסס ראייה

    הפעלת פונקציות וכלים על סמך ניתוח תמונות ודפי אינטרנט ישירות מתוך הקלט החזותי.

איפה זה נופל

היוצרים מודים בגלוי בבעיות מורגשות בכמה תחומים מרכזיים. שאלות ותשובות בטקסט בלבד חלשות באופן יחסי למודלים מקבילים, כיוון שרוב המאמץ הושקע ביכולות הוויזואליות. בנוסף, המודל נוטה לעיתים לחשיבת יתר, לחזרתיות בהנחיות מורכבות, ולחזרה מיותרת על התשובה בסוף הפלט. קיימות גם בעיות תפיסה מובהקות כמו ספירה לא מדויקת של אובייקטים בתמונה וזיהוי אנשים ספציפיים. השפות הרשמיות הן אנגלית וסינית בלבד, כך שאין להסתמך עליו בעיבוד טקסט בעברית.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

הכרטיס מציין תמיכה רשמית באנגלית ובסינית בלבד. אם תזינו מסמכים בעברית או תבקשו פלט מקומי, המודל עלול להיכשל בחילוץ הטקסט או להחזיר שגיאות הבנה, ולכן מומלץ לבדוק אותו מראש במשימות אלו.

למה המאגר שוקל 160 גיגה-בייט אם המודל הבסיסי קטן?

המאגר מכיל קבצים מרובים עם רמות דחיסה שונות בפורמט GGUF של unsloth. אין צורך להוריד את כל המאגר, אלא רק את הקובץ הספציפי שמתאים ליכולות הזיכרון והחומרה שלכם.

איך מריצים

המשקל הכולל של כלל הקבצים במאגר מגיע ל־160 גיגה-בייט ומחולק ל־32 קבצים, שכוללים רמות דיוק וכיול שונות מבית unsloth בשיטת Dynamic 2.0. בפועל אתם לא מורידים את כל המאגר אלא בוחרים קובץ קוונטיזציה יחיד שמתאים לגודל הזיכרון שיש לכם. למרות שהמודל הבסיסי מוגדר קל, הרצת הקשר מלא של 128 אלף טוקנים תדרוש זיכרון וידאו משמעותי, ולכן כדאי לתחום את האורך לפי הצורך האמיתי.

המפתחים מציינים סביבות הרצה כמו vLLM ו־SGLang, לצד ספריות תומכות כמו transformers. אם אין לכם חומרה ייעודית עם כרטיס גרפי מתאים, או אם אתם צריכים זמני תגובה יציבים בעומס גבוה בלי לנהל תשתית מקומית, עדיף להשתמש בגישת ה־API שהמפתחים מציעים בענן במקום להחזיק שרת עצמאי.

ollama run hf.co/unsloth/GLM-4.6V-Flash-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המאגר מפורסם ברישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש חופשי, כולל שילוב במוצרים מסחריים, עריכה, שינוי והפצה מחדש. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ותנאי הרישיון המקוריים בכל עותק או חלק מהותי של הקוד והמשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗