GPT
J

Jan-nano-128k

קוד פתוח

Menloapache-2.02025-06-25

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

מודל קומפקטי של 4 מיליארד פרמטרים עם חלון של 128 אלף טוקנים. הוא פונה למי שרוצה לעבד מסמכים ארוכים מקומית בלי לתפוס שרת שלם.

  • 4Bפרמטרים
  • 131,072טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 625הורדות בחודש

מה זה

המודל מבוסס על ארכיטקטורת Qwen3 ומגיע בגודל של 4 מיליארד פרמטרים, כשהוא מכוון בעיקר למשימות מחקר וניתוח טקסטים ארוכים. המפתחים הגדילו בו את חלון ההקשר ל־131,072 טוקנים, כך שאפשר להזין אליו מאמרים שלמים, שיחות מרובות שלבים וקבצים כבדים בלי לחתוך אותם לחלקים קטנים מראש.

בבדיקות של היוצרים מול מדד SimpleQA, המודל הציג שיפור לעומת הגרסה הקודמת שלו. לפי התיעוד הוא שומר על יציבות גם כשמנצלים את מלוא אורך ההקשר, וכולל תמיכה מובנית בחיבור לשרתי MCP לצורך הפעלת כלים וחיפוש מידע חיצוני.

מתאים ל

  • ניתוח מאמרי מחקר באנגלית

    חלון של 128 אלף טוקנים מאפשר לקרוא קובצי PDF ארוכים ולחלץ מהם נתונים ישירות.

  • עבודה מקומית עם שרתי MCP

    הוא נבנה לתמיכה בכלים חיצוניים ומאפשר חיבור לסוכני מחקר עצמאיים.

  • סיכום שיחות תמיכה מרובות

    גודל של 4B מאפשר עיבוד זול ומהיר של היסטוריית התכתבויות ארוכה.

איפה זה נופל

הכרטיס מדגיש שמדובר במודל ללא תהליך חשיבה מובנה, כלומר הוא לא מבצע שלבי ביניים של הסקת מסקנות לפני התשובה. בנוסף, המודל אומן והוגדר רשמית רק באנגלית, כך שהוא לא מתאים לעיבוד טקסטים בעברית. לפני שמשלבים אותו במוצר חובה לבדוק את התנהגות הכלים שלו, כיוון שמודלים קטנים של 4B נוטים לעיתים לפספס פרטים קטנים או להמציא עובדות כשההקשר נהיה עמוס.

אותה משפחה

Jan-nano יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הנתונים הרשמיים מגדירים את השפה שלו כאנגלית בלבד. מודלים שמבוססים על Qwen מסוגלים לעיתים לזהות עברית בסיסית, אבל כאן אין התחייבות לאיכות או דיוק ולכן לא מומלץ להסתמך עליו למשימות בעברית.

מה נדרש כדי להפעיל את מלוא ההקשר של 128k?

בזמן הפעלת השרת ב־vLLM או llama.cpp חובה להוסיף את פרמטרי ה־rope scaling שמופיעים בתיעוד עם פקטור 3.2. בלי ההגדרות האלה המודל ייעצר בהקשר המקורי ולא ינצל את כל החלון שהוקצה לו.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.5 גיגה בייט בפורמט bfloat16, כך שאפשר להריץ אותו על כרטיס מסך בודד עם 12 עד 16 גיגה זיכרון כדי להשאיר מקום לטעינת ההקשר המלא. מי שמחפש פריסה מהירה יכול להשתמש ב־vLLM או ב־llama.cpp, אך נדרש להגדיר ידנית הרחבת rope מסוג yarn עם פקטור של 3.2 כדי לעבוד עם כל 128 אלף הטוקנים.

אם אתם לא צריכים ניתוח של מסמכים שלמים בפעימה אחת או שאין לכם חומרה ייעודית, עדיף להשתמש ב־API חיצוני של מודלים גדולים יותר. ההרצה המקומית משתלמת בעיקר כשחשוב לכם שהמידע הרגיש לא ייצא מהרשת המקומית שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Menlo/Jan-nano-128k")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש או לשלב אותו בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗