נסו תרגיל קטן: בקשו מהצ'אטבוט המשוכלל בעולם לנסח ברכה ליום הולדת לסבתא. יש סיכוי לא רע שתקבלו טקסט חם ומרגש – שבו סבתא מבורכת בלשון זכר, איחול אחד נשמע כמו תרגום מילולי מאנגלית, והניגון כולו קצת זר. אותו מודל בדיוק כותב באנגלית שירה, מנסח חוזים ומסביר פיזיקה קוונטית. בעברית הוא נשמע, לא פעם, כמו תלמיד אולפן מצטיין – מרשים, אבל לא מקומי.
זו לא תחושה סובייקטיבית, וזה גם לא באג נקודתי. זו תוצאה ישירה של הדרך שבה מודלי שפה גדולים נבנים – ושל המקום השולי שהעברית תופסת בהם. אבל בשנתיים האחרונות מתגבשת תשובה ישראלית לבעיה, ובמרכזה מודל בשם DictaLM. כדי להבין למה צריך אותו, צריך קודם להבין למה העברית מסובכת כל כך למכונה.
מה כל כך קשה בעברית למכונה?
מודל שפה לומד את העולם מטקסטים. הוא מפרק משפטים ליחידות, מזהה דפוסים סטטיסטיים, ולומד לנבא את ההמשך. השיטה הזאת עובדת נהדר באנגלית – שפה שבה המילים קצרות יחסית, יציבות, ומופרדות יפה זו מזו. העברית משחקת לפי חוקים אחרים לגמרי.
ראשית, המורפולוגיה. העברית בנויה משורשים ומבניינים, ומילה אחת יכולה לשאת על גבה משפט שלם: "וכשנפגשנו" היא מילה אחת שמכילה חיבור, זמן, גוף ופועל. אותיות השימוש – ו', ה', ב', ל', ש' – נדבקות לתחילת המילה ומייצרות אינספור צורות לאותה מילת בסיס. מודל שלמד ש"בית" הוא מושג נפרד צריך ללמוד בנפרד גם את "הבית", "בבית", "ומהבית" ו"שבביתם".
שנית, הכתיב. עברית מודרנית נכתבת כמעט תמיד בלי ניקוד, ולכן אותו רצף אותיות יכול להיות כמה מילים שונות לחלוטין: "ספר" הוא גם חפץ, גם בעל מקצוע וגם פועל בעבר. "בעברית אין ניקוד, כל מילה אפשר לקרוא בכל מיני צורות, אין אותיות גדולות", הסבירה עוד ב-2022 פרופ' רעות צרפתי, חוקרת עיבוד שפה טבעית מאוניברסיטת בר-אילן, בכתבה שסקרה את הפער בין האנגלית לעברית בעולם הבינה המלאכותית. בני אדם פותרים את הדו-משמעות מההקשר בלי לשים לב; מכונה צריכה ללמוד את זה בכוח סטטיסטי – וכשחסר לה חומר לימוד, היא מנחשת.
וכאן הבעיה השלישית, הגדולה מכולן: הדאטה. מודלי הענק מאומנים על טריליוני טוקנים, אבל רק אחוז זעיר מהם מייצג שפות דלות-משאבים כמו עברית – כך מציינים חוקרי דיקטה בדוח הטכני של המודל העברי החדש שלהם. האינטרנט כותב באנגלית, ומי שלומד ממנו יודע בעיקר אנגלית. העברית, שפה של מיליונים בודדים, פשוט לא מספקת למכונה מספיק שעות לימוד.
טוקנים: המס הסמוי שהעברית משלמת
כדי להבין את הבעיה ההנדסית באמת, צריך להכיר מושג אחד: טוקן. מודל שפה לא קורא מילים – הוא קורא יחידות טקסט קטנות שקובע מראש רכיב שנקרא טוקנייזר. מילה אנגלית שכיחה מיוצגת בדרך כלל כטוקן אחד או שניים. ומה קורה לעברית אצל טוקנייזר שאומן בעיקר על אנגלית? היא מתרסקת לרסיסים.
המספרים, שנמדדו במעבדה של דיקטה, המרכז לניתוח טקסטים, מדהימים בחדותם: הטוקנייזר של מודל Mistral הצרפתי – אחד המודלים הפתוחים המובילים בעולם – מפרק מילה עברית ממוצעת ל-5.81 טוקנים. כמעט שישה חלקים למילה אחת, לעומת אחד-שניים באנגלית. כל שיחה בעברית דורשת פי כמה יחידות עיבוד מאותה שיחה באנגלית.
זה לא רק עניין אסתטי. ספקיות הבינה המלאכותית גובות כסף לפי טוקן, כך שטקסט עברי עולה יותר מהמקבילה האנגלית שלו. המהירות נפגעת, כי המודל מייצר את התשובה טוקן אחר טוקן. וגם "חלון ההקשר" – כמות הטקסט שהמודל מסוגל להחזיק בראש בבת אחת – מתכווץ בפועל, כי כל מסמך עברי תופס פי כמה טוקנים. העברית משלמת מס סמוי על כל מילה.
החדשות הטובות: המס הזה ניתן לביטול כמעט מוחלט, במחיר נמוך להפתיע. חוקרי דיקטה הראו שהוספת 1,000 טוקנים עבריים ייעודיים בלבד לאוצר המילים של הטוקנייזר חותכת את יחס הפירוק ביותר מחצי. בניסוי שתיעדו במאמר המדעי שלהם, אותו קורפוס עברי שדרש כ-204 מיליארד טוקנים בטוקנייזר המקורי של Mistral הצטמצם לכ-95 מיליארד טוקנים בגרסה המורחבת. אותו טקסט בדיוק – פחות ממחצית העלות.
DictaLM והמרוץ למודל עברי ריבוני
מאחורי המספרים האלה עומד גוף ישראלי אחד בעיקר: דיקטה – המרכז לניתוח טקסטים, עמותה ירושלמית שהקים ב-2015 פרופ' משה קופל. דיקטה התחילה מכלים לעולם הטקסט היהודי – מנועי חיפוש לתנ"ך ולתלמוד ו"נקדן" אוטומטי מבוסס רשתות נוירונים – אבל בעשור האחרון הפכה למעבדת העברית החשובה בארץ בתחום מודלי השפה.
בספטמבר 2023 שחררה דיקטה את DictaLM הראשון – מודל ראשוני בן 7 מיליארד פרמטרים שהוקדש לעברית מודרנית, מעין הצהרת כוונות לקהילת המחקר. ב-2024 הגיעה הקפיצה הגדולה: DictaLM 2.0, שנבנה על בסיס Mistral-7B בשיתוף מפא"ת – מינהל המחקר והפיתוח של משרד הביטחון – וחוקרים מאינטל. המודל אומן על כ-200 מיליארד טוקנים, חצי עברית וחצי אנגלית, עם אותו טוקנייזר מורחב שחתך את מס הטוקנים. לצד המודל השיקו החוקרים גם "ליגת מודלים" – לוח תוצאות ציבורי שמדרג מודלים לפי ביצועיהם בעברית, כדי שלקהילה יהיה לראשונה סרגל מדידה אחיד.
ובתחילת דצמבר 2025 הגיע הדור השלישי. Dicta-LM 3.0, שהדוח הטכני שלו פורסם בפברואר 2026, הוא כבר לא מודל אחד אלא משפחה שלמה: מודל דגל בן 24 מיליארד פרמטרים שנבנה על בסיס Mistral-Small 3.1, מודל ביניים בן 12 מיליארד פרמטרים על בסיס Nemotron של NVIDIA, ומודל קטן בן 1.7 מיליארד פרמטרים שמסוגל לרוץ גם על מכשירי קצה. שלושתם עברו אימון-המשך על כ-100 מיליארד טוקנים בעברית – לצד כ-30 מיליארד באנגלית – עם חלון הקשר של 65 אלף טוקנים, על גבי אשכול של 80 מעבדים גרפיים מסוג H200 בענן של NVIDIA. בין תורמי הדאטה: ספרים שנסרקו ועובדו דיגיטלית, בלוגים ורשתות חברתיות בעברית, טקסטים היסטוריים מפרויקט בן-יהודה, וגם הספרייה הלאומית.
הפרט המעניין באמת מסתתר במבחנים שבנו החוקרים למודל: לצד תרגום וסיכום, הם מדדו אותו גם על טריוויה ישראלית ועל ניקוד – משימות שאף מעבדה בקליפורניה לא תטרח לבדוק. לפי הדוח, מודל ה-24 מיליארד מציב רף חדש למודלים פתוחים דוברי עברית, ומדגים שמודל ריבוני ממוקד יכול לעקוף בשפתו מודלים כלליים גדולים ממנו.
ולמה בכלל "ריבוני"? כי מאחורי הפרויקט עומדת גם מדינה. עוד בסוף 2020 קבעה ועדה בראשות ד"ר ארנה ברי שתחום עיבוד השפה הטבעית בעברית ובערבית הוא כשל שוק – לענקיות הטכנולוגיה אין תמריץ כלכלי להשקיע בשפה קטנה – והמליצה לתקצב אותו ב-180 מיליון שקלים. מההמלצה נולדה התוכנית הלאומית לעיבוד שפה טבעית, שמובילים מפא"ת ורשות החדשנות, ובמסגרתה תוכנן עוד ב-2022 מודל שפה שיתבסס על 20 מיליארד מילים בעברית, בארכיטקטורה שתותאם לשפות שמיות. הדוח הטכני של Dicta-LM 3.0 נחתם בתודה מפורשת למפא"ת ולתוכנית הלאומית, שבלעדיהם – כך כותבים החוקרים – הפרויקט לא היה יוצא אל הפועל.
מה זה אומר למשתמש הישראלי?
בטווח המיידי, המודלים של דיקטה הם לא תחליף ל-ChatGPT של OpenAI – חברה שממשיכה להתרחב לכיוונים חדשים, כפי שסקרנו בעבר – או למתחרים מבית גוגל ואנת'רופיק. הענקים, שאומנו על טריליוני טוקנים, עדיין חזקים מאוד גם בעברית ברוב המשימות היומיומיות.
אבל המשמעות האמיתית נמצאת בשכבה שמתחת. המודלים של דיקטה משוחררים בקוד פתוח וברישיון מתירני, ולכן כל חברה ישראלית – בנק, קופת חולים, משרד ממשלתי – יכולה להוריד אותם, להריץ אותם על שרתים משלה ולהתאים אותם לצרכיה, בלי לשלוח נתונים רגישים לענן זר ובלי לשלם מס טוקנים על כל מילה בעברית. המודל הקטן, זה שרץ על מכשיר קצה, פותח את הדלת ליישומים שעובדים גם בלי אינטרנט. וסרגל המדידה הציבורי מייצר לחץ תחרותי בריא: גם הענקיות הבינלאומיות נמדדות היום, שחור על גבי לוח תוצאות, על העברית שלהן.
יש כאן גם עניין של זהות. מודל שאומן על טריוויה ישראלית, על ספרות עברית ועל בלוגים מקומיים לא רק כותב נכון יותר – הוא יודע דברים שמודל גלובלי לא יודע: מה עונים ל"מה נשמע", למה "יאללה ביי" הוא משפט שלם, ואיך נשמעת עברית שלא עברה דרך אנגלית. ריבונות טכנולוגית, מתברר, נמדדת גם ביכולת לספר בדיחה מקומית.
השאלה הגדולה: שפה קטנה בעולם של מודלים ענקיים
מאחורי הסיפור ההנדסי מסתתרת שאלה תרבותית כבדה. הבינה המלאכותית הופכת לממשק המרכזי שדרכו אנשים כותבים, לומדים ומחפשים מידע. אם הממשק הזה עובד מצוין באנגלית ובינוני בעברית, נוצר תמריץ שקט, יומיומי, לעבור לאנגלית – קודם במיילים בעבודה, אחר כך במסמכים, ובסוף אולי גם במחשבה. שפות לא נעלמות ברגע אחד; הן נשחקות שימוש אחר שימוש.
לכן הפרויקט הזה גדול מסך הפרמטרים שלו. יש סמליות לא מבוטלת בעובדה שבין חומרי האימון של המודל העברי נמצאים הטקסטים של פרויקט בן-יהודה – המיזם שקרוי על שם האיש שהוכיח, לפני מאה ומשהו שנים, ששפה אפשר להחיות בכוח הרצון. אליעזר בן-יהודה נלחם על כל מילה עברית חדשה מול עולם שדיבר בשפות אחרות. הגרסה של 2026 למאבק הזה נראית אחרת לגמרי – היא כתובה בפייתון ורצה על מעבדים גרפיים – אבל השאלה שבבסיסה זהה: האם העברית תהיה שפה שחיים בה, או שפה שמתרגמים אליה?
התשובה, כמו תמיד, תלויה במי שמוכן להשקיע. בינתיים, אי שם בירושלים, מכונה אחת לומדת לנקד.
שאלות ותשובות
למה הבינה המלאכותית עושה שגיאות דקדוק בעברית?
משלוש סיבות עיקריות: העברית עשירה מורפולוגית (שורשים, בניינים ואותיות שימוש שמייצרים אינספור צורות לכל מילה), הכתיב חסר הניקוד יוצר דו-משמעות שהמכונה מתקשה לפענח, וכמות הטקסט העברי שעליו אומנו המודלים הגדולים קטנה בסדרי גודל מכמות האנגלית. התוצאה: שגיאות בהתאמת מין ומספר, משלב לא עקבי ועברית שנשמעת מתורגמת.
מה זה מודל שפה ריבוני?
מודל שפה שמדינה או קהילה מפתחת ומחזיקה בעצמה, כך שהיכולת הלשונית לא תלויה בחסדי תאגיד זר: הדאטה, המשקולות והידע התרבותי נשארים בבית, ואפשר להריץ את המודל על תשתיות מקומיות. Dicta-LM הישראלי, שפותח בתמיכת מפא"ת והתוכנית הלאומית לעיבוד שפה טבעית ושוחרר בקוד פתוח, הוא דוגמה מובהקת.
האם יש צ'אטבוט שמבין עברית באמת?
המודלים המסחריים הגדולים השתפרו מאוד בעברית והם שמישים לרוב המטרות, אבל עדיין מועדים בניואנסים – סלנג, מגדר, הקשר ישראלי. המודלים של דיקטה מציבים כיום את הרף למודלים פתוחים בעברית, ומצטיינים דווקא במשימות המקומיות: ניקוד, ידע ישראלי ועברית טבעית. צ'אטבוט מושלם בעברית עוד אין – אבל הפער נסגר מהר.
מקורות
- Adapting LLMs to Hebrew: Unveiling DictaLM 2.0 with Enhanced Vocabulary and Instruction Capabilities – arXiv – https://arxiv.org/abs/2407.07080
- Dicta-LM 3.0: Advancing The Frontier of Hebrew Sovereign LLMs – arXiv – https://arxiv.org/abs/2602.02104
- אתגר הבינה המלאכותית של השפה העברית – ynet – https://www.ynet.co.il/digital/technology/article/sjgr9mmm9
- זמין עכשיו: מודל שפה ישראלי ענק שאומן על עברית – גיקטיים – https://www.geektime.co.il/this-is-the-first-major-hebrew-based-llm/
- Accelerating Hebrew LLM Performance with NVIDIA TensorRT-LLM – NVIDIA Developer Blog – https://developer.nvidia.com/blog/accelerating-hebrew-llm-performance-with-nvidia-tensorrt-llm/
- Introducing DictaLM: A Large Generative Language Model for Modern Hebrew – arXiv – https://arxiv.org/abs/2309.14568
- התוכנית הלאומית לעיבוד שפה טבעית – מפא"ת – https://nnlp-il.mafat.ai/
