GPT
J

Jan-v2-VL-high-gguf

קוד פתוח

janhqapache-2.02025-11-06

  • transformers
  • gguf
  • agent
  • image-text-to-text
  • en

מודל ראייה ושפה קומפקטי שמכוון במיוחד להפעלת סוכנים ולחיצה על ממשקים בלי לסטות מהמסלול. גרסת ה־high מעמיקה את תהליך החשיבה כדי לבצע רצף ארוך של צעדים.

  • 82.6 GBמשקל הקבצים
  • 21,171הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל בגודל 8B פרמטרים שמבוסס על Qwen-3-VL-8B-Thinking ועבר כוונון ייעודי למשימות ארוכות טווח בסביבות תוכנה אמיתיות, כמו דפדפנים ואפליקציות שולחניות. הרעיון המרכזי כאן הוא שילוב של ראייה ממוחשבת והסקת מסקנות טקסטואלית כדי לפעול צעד אחר צעד על סמך צילומי מסך, להחזיק מצב ביניים ולהתאושש משגיאות ביצוע קטנות.

לפי המפתחים, המודל שומר על היכולות של מודל הבסיס במשימות טקסט וראייה רגילות, ואפילו מציג שיפור קל בחלקן. ההבדל המשמעותי מופיע במבחן Illusion of Diminishing Returns, שבודק יציבות לאורך שרשרת פעולות מתמשכת. במקום לקרוס או לסטות אחרי כמה צעדים, הוא מתוכנן לשמור על עקביות ולבצע קריאות לכלים ברצף ארוך.

מתאים ל

  • אוטומציה של דפדפנים

    ניתוח צילומי מסך והפעלת כלי דפדפן צעד אחר צעד ברצף ארוך ויציב.

  • שליטה באפליקציות שולחן עבודה

    זיהוי רכיבי ממשק מתוך תמונות ותרגומם לקריאות כלים עוקבות.

  • התאוששות משגיאות ריצה

    מעקב אחר חיווי חזותי לתיקון פעולות שלא הצליחו בניסיון הראשון.

איפה זה נופל

המאגר הנוכחי מסווג כרגע רק לשפה האנגלית, כך שאין שום הבטחה או עדות ליכולת שלו לקרוא ממשקים בעברית או להפיק פקודות מדויקות בשפה הזו. שנית, התיעוד מבהיר שהמודל מיועד בעיקר למשימות שבהן התוכנית או הידע סופקו מראש, כך שהוא פחות מתאים לתרחישים פתוחים שדורשים ממנו להמציא פתרונות מאפס ללא הכוונה ברורה.

אותה משפחה

Jan-v2-VL-high יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מחברים את מודל הראייה ב־llama.cpp?

הקובץ הראשי לא מחזיק את כל המשקולות הוויזואליות בעצמו. צריך להוריד את קובץ המודל לצד קובץ ה־mmproj התואם, ולהגדיר לשרת את הפרמטר vision-model-path יחד עם ביטול context-shift.

האם המודל יבין ממשקים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. לא כדאי להסתמך עליו לקריאת צילומי מסך של תוכנות בעברית או לעבודה מול שדות טקסט מקומיים בלי לבדוק את זה ידנית קודם.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־82.6 גיגה-בייט ומחולק ל־18 קבצים, שכוללים קובצי GGUF שונים ורכיבי mmproj לטעינת הראייה. כדי להריץ אותו מקומית אפשר להשתמש באפליקציית Jan, להרים שרת עם llama-server תוך ציון נתיב מפורש למודל הוויזואלי, או לטעון את גרסת המקור דרך vLLM עם מפענחי hermes לכלים ו־qwen3 לחשיבה.

מודל של 8B רץ יפה על כרטיסי מסך ביתיים עם 12 עד 16 גיגה זיכרון וידאו ברמות כימות סטנדרטיות, אבל גרסת ה־high לוקחת יותר זמן חשיבה בכל צעד. אם המטרה היא תגובה מיידית ולא ביצוע משימות מורכבות, כדאי לשקול את גרסאות low או med שתוכננו לזמני השהיה נמוכים יותר.

ollama run hf.co/janhq/Jan-v2-VL-high-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗