GPT

מודלים ותשתית · בתשלום

הלוגו של The Embedding Archives

The Embedding Archives

מדובר במאגר נתונים מוכן של וקטורים שמייצגים מיליוני פסקאות מתוך ויקיפדיה במספר שפות, כולל הטקסט והמטא-דאטה. במקום לגרוף טקסטים, לנקות אותם ולהריץ מודלים שיעלו אלפי דולרים רק כדי להתחיל פרויקט, מקבלים את הייצוג המתמטי מוכן לשימוש מיידי.

ההבדל המשמעותי הוא החיסכון בעבודת ההכנה ובזמן חישוב יקר. המאגר יושב ישירות ב־Hugging Face Datasets ופוטר אתכם מהצורך לבנות תשתית שלמה לפני שבדקתם אם הרעיון שלכם בכלל עובד.

  • מודלים ותשתית
  • בתשלום
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
בתשלום
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
txt.cohere.com
נבדק
2026-09-08

הסקירה

Cohere שחררה מאגר נתונים פתוח להורדה שמכיל 94 מיליון וקטורים של פסקאות מתוך Wikipedia בעשר שפות שונות. המאגר נשען על מודל multilingual-22-12 של החברה ומפרק ערכים שלמים למקטעים קצרים, כאשר לכל קטע מוצמד וקטור ייצוג מתמטי באורך 768 מספרים. הקבצים יושבים בשרתי Hugging Face Datasets וכוללים את הטקסט המקורי, כותרת המאמר, המטא-דאטה והווקטור המחושב מראש. המטרה היא לאפשר פיתוח של מנועי חיפוש סמנטיים בלי לבזבז זמן ומשאבי מחשוב על יצירת וקטורים למיליוני דפי אנציקלופדיה מאפס.

וקטורים מוכנים חוסכים המון שעות עיבוד יקרות.

מי שבונה מנוע חיפוש סמנטי יודע שהשלב הראשוני של המרת טקסט למספרים דורש כוח חישוב עצום וחשבון ענן תופח. Cohere ביצעה את העבודה הזו מראש על מיליוני ערכים, כולל 35 מיליון פסקאות באנגלית, 15 מיליון בגרמנית ו-3 מיליון בערבית. במקום להריץ מיליוני קריאות API למודל ייצוג וקטורי ולשלם עליהן, אתם פשוט מורידים חבילת נתונים מוכנה בקוד פייתון קצר. זה מקצר את המעבר מרעיון לאב-טיפוס עובד מכמה שבועות לכמה דקות בלבד, ומאפשר לבדוק אלגוריתמים של שליפת מידע ישירות מול נתוני אמת.

מה יש במאגר ואיך ניגשים

עבודה עם המאגר

  1. 01טעינת נתונים באמצעות Hugging Face
  2. 02ייצוג שאילתה בעזרת co.embed
  3. 03חישוב דמיון במכפלה סקלרית
  4. 04שליפת התוצאות המובילות במערך

השימוש במאגר שווה את זה רק אם אתם מפתחים מערכת שמחפשת בתוך ידע כללי עולמי. אם אתם זקוקים לחיפוש במסמכים הפנימיים של החברה שלכם, הנתונים של Wikipedia לא יעזרו לכם בכלום ותצטרכו לקודד את המידע שלכם בעצמכם. נוסף על כך, עברית פשוט אינה קיימת בארכיון הזה. הרשימה כוללת שפות כמו הינדי, קוריאנית וסינית פשוטה, אבל השפה המקומית שלנו נותרה בחוץ. אם האפליקציה שלכם מיועדת לקהל ישראלי ודורשת תוכן מקומי, המאגר הספציפי הזה חסר תועלת מעשית עבורכם כרגע.

מפתח ישראלי יצטרך לבנות וקטורים בעצמו.

עלויות המאגר ומחירי המודלים

הורדת קובצי הווקטורים עצמם מתוך Hugging Face אינה עולה כסף, אבל תפעול של מערכת אמיתית מסביבם דורש תקציב שוטף. כדי למצוא התאמה בין שאילתת המשתמש לבין הווקטורים שהורדתם, תצטרכו להמיר את מילות החיפוש לווקטור תואם באותו מודל בדיוק. Cohere מציעה מפתח Trial חינמי להתנסות מוגבלת בקצב הבקשות, אך הוא אסור לשימוש מסחרי. מעבר לסביבת ייצור דורש מפתח Production בתשלום לפי שימוש, כאשר חשבון חודשי מונפק בכל סוף חודש קלנדרי או ברגע שמגיעים ליתרה של 250 דולר.

אם תרצו להריץ שרת ייעודי של מודלי החברה דרך Model Vault, המחירים הופכים לכבדים במיוחד. מודל כמו Embed 4 עולה 4 דולר לשעה ברמת ביצועים נמוכה, או 2,500 דולר לחודש פר מופע שרת. מודל Rerank מתחיל ב-5 דולר לשעה ומגיע ל-10 דולר לשעה או 6,500 דולר לחודש ברמות הגבוהות. מה שבאמת מפריע כאן הוא שאין מחיר ביניים גמיש לצוותים קטנים שרוצים שרת מבודד, כך שרוב המפתחים העצמאיים יצטרכו להסתפק ב-API הציבורי הרגיל.

  • הורדת המאגרחינם ב-Hugging Face
  • מפתח מסחריתשלום לפי שימוש
  • תמיכה בעבריתלא קיימת בארכיון

התשתית הזו מתאימה לחברות שמשלבות ידע אנציקלופדי כחלק ממוצר חיפוש קיים. לא הייתי משתמש בזה לפרויקטים שדורשים עדכניות גבוהה, כי הנתונים נלקחו מתוך גרסת ויקיפדיה קפואה בזמן ולא משקפים עריכות חדשות. עבור חוקרי בינה מלאכותית ומפתחי אלגוריתמים, מדובר באוצר שחוסך משאבי חישוב כבדים. עסקים קטנים שמחפשים פתרון מדף לניהול מסמכים יגלו שמדובר רק בקובצי גלם שדורשים כתיבת קוד מלאה וניהול שרתי וקטורים עצמאיים, ולא במוצר פרודוקטיביות שמתקינים בלחיצת כפתור.

זה לא מוצר מוגמר.

מה The Embedding Archives
עושה

אתם מושכים את המאגר דרך ספריית ה־datasets של פייתון ישירות מ־Hugging Face, למשל את המאגר באנגלית פשוטה שמכיל 486 אלף פסקאות. סך הכל יש בארכיון 94 מיליון וקטורים, ביניהם 35 מיליון באנגלית, 3 מיליון בערבית ועוד שפות כמו ספרדית, יפנית וגרמנית.

כל שורה במאגר מכילה את הטקסט, מטא-דאטה ומערך של 768 מספרים שנוצרו על ידי המודל הרב-לשוני של Cohere. כדי לבצע חיפוש, אתם שולחים שאילתה למודל ההטמעה דרך ה־API, מקבלים וקטור לשאילתה, ומחשבים מכפלה סקלרית בינו לבין הוקטורים בארכיון כדי לשלוף את התוצאות הכי קרובות.

כמה זה
עולה

הורדת קובצי הנתונים עצמם מ־Hugging Face היא בחינם, אך שימוש במודל ההטמעה של החברה לחיפוש בזמן אמת דורש מפתח API. קריאות ניסיון אינן עולות כסף אך מוגבלות בקצב ואסורות לשימוש מסחרי, בעוד ייצור מסחרי מחושב לפי שימוש או בתשלום חודשי דרך תוכניות ייעודיות שמתחילות באלפי דולרים.

$4,300/mo

המספרים נקראו מעמוד התמחור של The Embedding Archives ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

מפתחים וחוקרי דאטה שרוצים לבנות מנוע חיפוש סמנטי או מערכת אחזור מידע על בסיס ויקיפדיה בלי לבזבז ימי עבודה ומשאבי מחשוב על עיבוד ראשוני. זה מצוין לבדיקת היתכנות מהירה באנגלית, גרמנית, ערבית או שפות מרכזיות אחרות שקיימות במאגר.

מי שצריך מאגר בעברית ייאלץ לוותר, כי עברית אינה מופיעה ברשימת השפות של הארכיון הזה. זה גם לגמרי מיותר למי שבונה אפליקציה שמחפשת רק בתוך מסמכים ארגוניים פרטיים ולא צריכה ידע אנציקלופדי כללי.

מה לבדוק
לפני שמתחייבים

שימו לב שהוקטורים הופקו ספציפית באמצעות מודל multilingual-22-12 של Cohere עם ממד של 768. המשמעות היא שאתם נעולים לחלוטין: כדי להשוות שאילתות חדשות אל מול המאגר, אתם חייבים להשתמש באותו מודל בדיוק ולא תוכלו לחבר מודל פתוח אחר בלי להטמיע את כל 94 מיליון הפסקאות מחדש בעצמכם.

בנוסף, הנתונים הוקפאו בסוף 2022, כך שכל ערך חדש או עדכון שנכנס לויקיפדיה מאז פשוט לא קיים שם.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על The Embedding Archives כאן. אם השתמשתם בThe Embedding Archives, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה The Embedding Archives
אומר על עצמו

Cohere's massive archive of embedding vectors from Wikipedia can be freely downloaded and used to power applications.

מהאתר של The Embedding Archives, נקרא ב־2026-09-08. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם אפשר להשתמש במאגר למטרות מסחריות?

המאגר עצמו פתוח להורדה, אבל אם תרצו לחבר אליו חיפוש בזמן אמת באמצעות ה־API של החברה, מפתח הניסיון החינמי לא יספיק. שימוש מסחרי מחייב מעבר לחשבון ייצור בתשלום שוטף לפי שימוש.

כמה זיכרון דורש שימוש בכל המאגר באנגלית?

המאגר באנגלית כולל 35 מיליון וקטורים בגודל 768 מספרים כל אחד. חישוב פשוט מראה שמדובר בעשרות ג'יגה-בייט של נתונים, כך שתצטרכו תשתית מתאימה או בסיס נתונים וקטורי ייעודי כדי להריץ עליו חיפושים מהירים.

מה The Embedding Archives עושה?

מדובר במאגר נתונים מוכן של וקטורים שמייצגים מיליוני פסקאות מתוך ויקיפדיה במספר שפות, כולל הטקסט והמטא-דאטה. במקום לגרוף טקסטים, לנקות אותם ולהריץ מודלים שיעלו אלפי דולרים רק כדי להתחיל פרויקט, מקבלים את הייצוג המתמטי מוכן לשימוש מיידי. ההבדל המשמעותי הוא החיסכון בעבודת ההכנה ובזמן חישוב יקר. המאגר יושב ישירות ב־Hugging Face Datasets ופוטר אתכם מהצורך לבנות תשתית שלמה לפני שבדקתם אם הרעיון שלכם בכלל עובד.

האם The Embedding Archives חינמי?

לפי האתר שלו: בתשלום. מומלץ לאמת מול עמוד התמחור, כי תנאים משתנים.

האם The Embedding Archives תומך בעברית?

האתר של The Embedding Archives מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־The Embedding Archives?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • הלוגו של The Pile קוד פתוח

    The Pile

    מאגר נתונים פתוח של 825 גיגהבייט לאימון והערכה של מודלי שפה.

    מודלים ותשתית pile.eleuther.ai
  • T קוד פתוח

    Torch7

    סביבת פיתוח וחישוב מדעי ללמידת מכונה ששמה את המעבדים הגרפיים במרכז.

    מודלים ותשתית torch.ch
  • הלוגו של TrueFoundry קוד פתוח

    TrueFoundry

    שער מרכזי לניתוב, אבטחה וניטור של מודלי שפה, שרתי MCP וסוכני בינה מלאכותית.

    מודלים ותשתית truefoundry.com
  • הלוגו של TruLens for LLMs קוד פתוח

    TruLens for LLMs

    מעקב והערכה לסוכני בינה מלאכותית, שמציגים איפה הם נכשלים וכמה עולה כל צעד

    מודלים ותשתית trulens.org
  • T קוד פתוח

    Truss

    אריזה והגדרה של מודלי בינה מלאכותית בקונטיינרים לפריסה בייצור.

    מודלים ותשתית truss.baseten.co
  • הלוגו של UAF קוד פתוח

    UAF

    דומיין אינטרנט שמוצע כרגע למכירה ולא מפעיל שום שירות פעיל.

    מודלים ותשתית uaf.ai