GPT
H

HRM-Text-1B

קוד פתוח

sapientincapache-2.02026-05-17

  • transformers
  • safetensors
  • hrm_text
  • text-generation
  • hrm

ארכיטקטורה ניסיונית שמריצה לולאות חישוב פנימיות על אותם פרמטרים. מתאים למי שרוצה בסיס קטן לאימון ומחקר ולא עוזר צ'אט מוכן.

  • 1.2Bפרמטרים
  • 4,096טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 26,333הורדות בחודש

מה זה

מדובר במודל שפה של 1.2 מיליארד פרמטרים שמבוסס על ארכיטקטורת HRM. במקום לערום עשרות שכבות נפרדות, הוא מחלק את הרשת לשני מודולים של 16 שכבות שרצים בלולאות חוזרות על אותו קלט, מה שמעמיק את החישוב בלי לנפח את הזיכרון.

זהו צ'קפוינט גולמי לחלוטין שלא עבר התאמות שיחה, הוראות או יישור התנהגותי. הוא מאומן בשיטת PrefixLM, כך שצריך להעביר לו תחיליות ייעודיות כמו direct למשימות מובנות או synth,cot להסקה בחלקים, אחרת מקבלים פלט לא ממוקד.

אימנו אותו על 40 מיליארד טוקנים בלבד, מספר נמוך מאוד ביחס לסטנדרט הנוכחי. לכן הוא לא מתחרה במודלים שראו טריליוני טוקנים, אלא מדגים יעילות של ארכיטקטורה שונה.

מתאים ל

  • בסיס לכיוונון משימות באנגלית

    מודל קל משקל שמתאים למי שרוצה לאמן בעצמו משימות סיווג, מיצוי מידע או שאלות ותשובות קצרות.

  • מחקר ארכיטקטורות חישוביות

    בדיקת ההשפעה של מנגנוני חישוב חוזרים על יעילות מודלים קטנים בהשוואה לטרנספורמר רגיל.

  • הסקה מקומית עם מעט דוגמאות

    הרצה מקומית על כרטיס מסך ביתי עבור משימות מובנות תוך שימוש בתחילית ייעודית וכמה דוגמאות בקלט.

איפה זה נופל

הוא לא מבין עברית. האימון נעשה באנגלית בלבד, ופניות בשפות אחרות פשוט לא יעבדו. בנוסף, לא הכניסו קוד לנתוני האימון, ולכן ביצועי התכנות שלו כמעט אפסיים ללא אימון נוסף.

הוא לא עבר שום סינון בטיחותי או התאמה להוראות. אם לא מספקים לו כמה דוגמאות בתוך הפרומפט ותחיליות מדויקות, התשובות עשויות להיות חלקיות, לא מדויקות או לקויות בניסוח. זה בסיס עבודה למפתחים ולא כלי שמשלבים ישירות מול לקוח.

שאלות
נפוצות

אפשר להשתמש בו לצ'אט בעברית?

לא. המודל אומן על קורפוס באנגלית בלבד ולא מבין עברית. מעבר לכך, הוא לא עבר אימון שיחה, כך שגם באנגלית הוא לא מתנהג כמו עוזר אישי.

למה התשובות יוצאות מקוטעות בריצה רגילה בפייתון?

בגלל שיטת ה־PrefixLM שלו, חובה להעביר token_type_ids עם ערכי 1 עבור כל הפרומפט. אם משמיטים את זה, המודל מפעיל קשב רגיל והתוצאות נפגעות משמעותית.

הוא יודע לכתוב קוד?

כרגע לא. נתוני האימון לא כללו קבצי קוד, והכרטיס מציין ביצועים נמוכים מאוד בתחום הזה. אפשר לשפר את זה רק אם מאמנים אותו מחדש על דאטה ייעודי.

איך מריצים

המשקל הכולל עומד על 2.2 ג'יגה בייט בפורמט bfloat16. כל כרטיס מסך בסיסי עם 6 עד 8 ג'יגה זיכרון מריץ אותו מקומית בלי מאמץ, ואפילו על מעבד רגיל אפשר לבצע בדיקות ראשוניות.

צריך ספריית transformers מגרסה 5.9.0 ומעלה שכוללת תמיכה בארכיטקטורה הזו. בזמן הריצה חובה להעביר מערך של token_type_ids מלא באחדות עבור הפרומפט, כדי להפעיל קשב דו כיווני כפי שהיה באימון, אחרת הביצועים צונחים. אם מחפשים תשובות מוכנות למשתמשי קצה בלי לאמן מודל לבד, עדיף להשתמש ב־API מסחרי.

from transformers import pipeline

pipe = pipeline("text-generation", model="sapientinc/HRM-Text-1B")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לאמן אותו מחדש ולהפיץ אותו בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗