GPT
J

Jan-v3-4B-base-instruct-gguf

קוד פתוח

janhqapache-2.02026-01-20

  • transformers
  • gguf
  • code
  • text-generation
  • en

גרסת GGUF של מודל קומפקטי עם 4 מיליארד פרמטרים וחלון הקשר ענק. הוא פותח באמצעות זיקוק ממודל גדול כדי לשמש בסיס נוח לכוונון עדין או להרצה מקומית קלה.

  • 46.8 GBמשקל הקבצים
  • 3,071הורדות בחודש
  • 56לייקים

מה זה

מדובר במודל שנוצר באמצעות זיקוק ידע (distillation) ממודל מורה גדול יותר אל תוך ארכיטקטורה של 4 מיליארד פרמטרים עם 36 שכבות. המטרה של המפתחים הייתה לייצר משקל בסיס קטן ששומר על יכולות מענה להוראות בלי לאבד ביצועים כלליים, כזה שאפשר להריץ על חומרה צנועה יחסית או לקחת כקרקע יציבה לאימון נוסף.

הנתון הבולט במפרט הוא חלון הקשר מובנה של 262,144 טוקנים, שזה היקף חריג מאוד לגודל כזה. השימוש ב־GQA (עם 32 ראשי Q ו־8 ראשי KV) אמור לעזור בניהול הזיכרון של ההקשר הזה, והחברה מייעדת אותו בעיקר למשימות של סיוע בקוד, עבודה מבוססת סוכנים ומעקב אחרי הוראות.

מתאים ל

  • בסיס לכוונון עדין

    נקודת מוצא זולה ומהירה לאימון מותאם אישית בזכות ארכיטקטורת 4B קלה ששומרת על יכולות הוראה בסיסיות.

  • סוכן מקומי להפעלת כלים

    הרצה מקומית עם תמיכה מובנית ב־tool call parser לעבודה אוטונומית קלה מול מערכות חיצוניות.

  • עיבוד טקסטים ארוכים באנגלית

    הזנת מסמכים רחבים עד 262 אלף טוקנים ישירות למודל מקומי בלי לחתוך אותם מראש.

איפה זה נופל

הכרטיס מצהיר על אנגלית בלבד (en). אין פה שום הבטחה או עדות לתמיכה סבירה בעברית, ולכן לשימושים בשפה המקומית סביר מאוד שהוא ייכשל או ייצר טעויות גסות.

מעבר לזה, למרות ההבטחה לחלון של 262 אלף טוקנים, מודלים בגודל 4B מזוקקים לעיתים קרובות מאבדים אחיזה, שוכחים עובדות באמצע הטקסט או מתחילים להזות כשמעמיסים עליהם מסמכים ארוכים מאוד. לפני שמסתמכים עליו לשליפת מידע ארוכה, חובה לבדוק איך הוא מחזיק את ההקשר בפועל.

אותה משפחה

Jan יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

התיעוד הרשמי מציין אנגלית בלבד. סביר שהוא יתקשה מאוד לייצר או להבין עברית באופן שוטף, ולא כדאי לבנות עליו לפרויקט מקומי בלי לבדוק אותו קודם או לבצע כוונון מתאים.

איך מריצים אותו מקומית בצורה הכי פשוטה?

אפשר להוריד את קובץ ה־GGUF ולהריץ דרך llama-server עם דגל jinja, או פשוט לטעון אותו לתוך אפליקציית Jan Desktop אם מעדיפים ממשק גרפי.

איך מריצים

המודל מופץ בפורמט GGUF, מה שאומר שאפשר להרים אותו ישירות דרך llama.cpp בפקודה פשוטה עם llama-server, או בתוך האפליקציה של Jan Desktop. המפתחים ממליצים להריץ אותו בפרמטרים של טמפרטורה 0.7, top_p של 0.8 ו־top_k של 20 כדי לקבל איזון טוב במשימות כלליות ומערכות סוכנים.

אם אתם צריכים שרת מהיר יותר לייצור, יש גם תמיכה ישירה ב־vLLM עם כלי Hermes לקריאות לפונקציות (tool calling). מודל של 4B בקוונטיזציה סבירה ירוץ בלי בעיה על רוב כרטיסי המסך הביתיים המודרניים, אבל אם תנסו לדחוף את כל חלון ההקשר המלא של 260 אלף טוקנים, צריכת הזיכרון של ה־KV cache תקפוץ ותדרוש הרבה יותר זיכרון ממה שהמשקלים עצמם צורכים.

ollama run hf.co/janhq/Jan-v3-4B-base-instruct-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל משוחרר תחת רישיון apache-2.0. זה רישיון פתוח ומתירני לחלוטין שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים, הפצה ושילוב במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗