GPT
C

colibri-embed-ptbr

קוד פתוח

tardellirsgemma2026-07-04

  • sentence-transformers
  • safetensors
  • gemma3_text
  • feature-extraction
  • sentence-similarity

מודל שיכוך קומפקטי לפורטוגזית ברזילאית שמבוסס על גמא. הוא מיועד למי שצריך חיפוש סמנטי מדויק בפורטוגזית בעלויות אפסיות ועל גבי מעבד רגיל.

  • 151Mפרמטרים
  • 2,048טוקנים בהקשר
  • 603 MBמשקל הקבצים
  • 7,061הורדות בחודש

מה זה

המודל הזה נולד מכיווץ של מודל הבסיס מבית גוגל, תוך חיתוך אגרסיבי של אוצר המילים ממאות אלפים לכשישים וארבעה אלף טוקנים שרלוונטיים רק לפורטוגזית ברזילאית. היוצר זיקק לתוכו ידע משני מודלים גדולים של קוון באמצעות כמאה אלף קטעי טקסט מקומיים, כולל חומרים משפטיים, רפואיים ופיננסיים, ואיחד את המשקולות לכדי רשת נקייה בלי מתאמים.

במבחני בנצ'מרק של שפה זו הוא הגיע לציון ממוצע של 0.6501 על פני עשרים ושתיים משימות שונות. המשמעות בפועל היא שהוא עוקף מודלים רב-לשוניים עצומים של שבעה ואף עשרים ושבעה מיליארד פרמטרים על הדאטה הספציפי הזה, ותופס חצי מנפח הזיכרון של מודל המקור.

מתאים ל

  • חיפוש סמנטי בפורטוגזית

    שליפת מסמכים מדויקת באתרי תוכן וספריות ידע שכתובים בפורטוגזית ברזילאית.

  • מערכות RAG זולות

    שליפת הקשר למודלי שפה על גבי שרת מעבד פשוט וללא עלויות של כרטיסי מסך.

  • סיווג טקסטים מקצועיים

    הבחנה בין מסמכים רפואיים, פיננסיים או משפטיים מקומיים לפי המבנה הסמנטי שלהם.

איפה זה נופל

הקיצוץ במילון הפך אותו לכלי ייעודי לחלוטין לפורטוגזית ברזילאית, כך שאינו מתאים לעבודה בעברית, באנגלית או בכל שפה אחרת. חלון ההקשר מוגבל ל־2,048 טוקנים, מה שדורש לחתוך מסמכים ארוכים למקטעים לפני העיבוד. בנוסף, אף שהרצת ONNX מהירה יותר, היא מקפיצה את שיא צריכת הזיכרון ל־2.9 ג'יגה-בייט לעומת פחות מג'יגה במצב הרגיל.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או באנגלית?

לא. אוצר המילים של המודל קוצץ במיוחד והושאר רק עם טוקנים שמתאימים לפורטוגזית של ברזיל, כך שעל שפות אחרות הוא לא יעבוד כראוי.

האם נדרש כרטיס מסך כדי לקבל זמני תגובה טובים?

ממש לא. הוא נבדק על שרת מעבד רגיל של 4 ליבות ומייצר וקטורים בזמן של 33 מילישניות באמצעות מנוע ONNX.

באיזה ממד וקטור כדאי להשתמש באינדקס?

ברירת המחדל היא 768 ממדים לדיוק המרבי של הבנצ'מרק, אך בזכות תמיכה במטריושקה אפשר לקטום ל־256 או 128 כדי לצמצם עלויות אחסון.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers עם תמיכה מובנית ב־ONNX, שמקצרת את זמן התגובה ל־33 מילישניות על מעבד וסוחטת כמעט 50 משפטים בשנייה. אין שום צורך בכרטיס מסך יקר, שרת וירטואלי פשוט עם ארבע ליבות מעבד וזיכרון צנוע יחזיק אותו בלי בעיה. בגרסת ברירת המחדל הוא שוקל כ־607 מגה-בייט וצורך פחות מג'יגה-בייט של זיכרון עבודה.

יש גרסת חצי דיוק ששוקלת 304 מגה-בייט לחיסכון באחסון או למי שבכל זאת מריץ על כרטיס מסך, וניתן לקטום את הווקטור מ־768 ממדים לערכים נמוכים יותר כדי לחסוך מקום באינדקס החיפוש. אין היגיון לשלם כאן על API חיצוני, המודל מספיק קל ומהיר להרצה עצמית זולה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("tardellirs/colibri-embed-ptbr")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא רישיון תנאי השימוש של גמא מבית גוגל. הוא מאפשר שימוש מסחרי חופשי, אך מטיל מגבלות שימוש מקובלות ומחייב ציות לתנאי הרישוי המקוריים של משפחת המודלים הזו בהפצה של תוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗