GPT
L

llm-jp-4-33b-thinking

קוד פתוח

llm-jpapache-2.02026-08-14

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

מודל פתוח של 33 מיליארד פרמטרים שמתמקד ביפנית ואנגלית, עם יכולות חשיבה וחלון הקשר רחב. הוא מתאים למי שחייב אירוח מקומי ומשימות מורכבות ביפנית.

  • 33Bפרמטרים
  • 65,536טוקנים בהקשר
  • 61.9 GBמשקל הקבצים
  • 17,739הורדות בחודש

מה זה

הפרויקט היפני מציע כאן מודל צפוף שאומן על 11.7 טריליון טוקנים ועבר כוונון עדין ואופטימיזציית העדפות ישירה ללא למידת חיזוק. המבנה שלו מבוסס על 64 שכבות ורוחב הקשר של 65,536 טוקנים, מה שנותן לו יכולת לעבד טקסטים ארוכים במיוחד בשתי השפות הנתמכות.

במבחני MT Bench עם מאמץ חשיבה בינוני, מול שופט מבוסס מודל חיצוני, הוא הוציא ציון של 8.00 ביפנית ו־8.24 באנגלית. התוצאות האלה עוקפות מודלים מסחריים ותיקים יותר כמו gpt-4o שנבדק באותו מערך, ומראות שהוא יודע להחזיק שיחה רב־שלבית ולפתור בעיות מורכבות בצורה סבירה, במיוחד בטקסטים ביפנית שמודלים מערביים מתקשים בהם.

מתאים ל

  • ניתוח מסמכים ביפנית

    חלון של 65,536 טוקנים מאפשר לקרוא חוזים ודוחות ארוכים ביפנית בלי לחתוך את הטקסט לחלקים.

  • אירוח מקומי ומאובטח

    מתאים לשרת פרטי של ארגון שמעבד מידע רגיש באנגלית וביפנית ולא יכול לשלוח נתונים החוצה.

  • משימות חשיבה מורכבות

    מנגנון החשיבה המובנה משפר את איכות התשובות בשיחות רב־שלביות מורכבות הדורשות הסקת מסקנות.

איפה זה נופל

היוצרים מציינים במפורש שהמודל נמצא בשלבי מחקר מוקדמים, ולא עבר כוונון שמבטיח התאמה מלאה לכוונת המשתמש או עמידה בכללי בטיחות. מדד AnswerCarefully שלו עומד על 3.79 בלבד, מה שמחייב בדיקות זהירות ומנגנוני סינון חיצוניים לפני שחושפים אותו למשתמשי קצה.

בנוסף, הטוקנייזר שלו ייחודי ולא תואם ישירות לספריות חיצוניות כמו openai-harmony, למרות שתבנית השיחה תוכננה להיות תואמת למבנה הזה. מעבר לזה, המודל אומן רק על אנגלית ויפנית, כך שאין מה לצפות לביצועים סבירים בעברית.

אותה משפחה

llm-jp-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעיבוד טקסטים בעברית?

לא כדאי לבנות על זה. המודל אומן ונבדק על אנגלית ויפנית בלבד, והטוקנייזר שלו הותאם לשפות האלה, כך שביצועיו בשפות אחרות יהיו חלשים מאוד.

האם הוא מגיע מוכן לשימוש ישיר מול לקוחות קצה?

לא בלי שכבת הגנה. כרטיס המודל מבהיר שהוא לא כוונן לבטיחות מלאה, ולכן הוא עלול לפלוט תוכן לא רצוי במקרים מסוימים אם לא תציבו מולו סינון קלט ופלט.

איך מריצים

כדי להריץ אותו צריך כרטיס גרפי רציני או שרת ייעודי. הקבצים שוקלים 61.9 גיגה־בייט בדיוק bfloat16, כך שתצטרכו לפחות 80 גיגה־בייט של זיכרון גרפי, כמו כרטיס A100 או H100 בודד, רק כדי לטעון אותו לפני שמתחילים לצרוך זיכרון עבור חלון ההקשר. לחלופין, אפשר לחלק אותו על פני שני כרטיסים קטנים יותר.

בסדרה הזו יש גם גרסת 8B קלה בהרבה וגרסת תערובת מומחים שמפעילה רק חלק מהפרמטרים. אם המטרה היא סביבת פיתוח פשוטה, הגרסאות הקטנות עדיפות, ואם יש צורך רק בשאילתות בודדות ללא דרישת פרטיות מחמירה, כדאי לשקול מודלים מנוהלים בענן כדי להימנע מעלויות החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="llm-jp/llm-jp-4-33b-thinking")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להטמיע אותו בתוך מוצר סגור ולהפיץ אותו חופשי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗