Skip to content
טכנולוגיה

הבינה המלאכותית עוברת לגור בכיס: המהפכה השקטה של המודלים הקטנים

בלי ענן ובלי אינטרנט: בינה מלאכותית בטלפון כבר מתמללת, מתרגמת ומסכמת ישירות על השבב. מה זה NPU, איך דוחסים מודל שלם לכיס, ומה זה עושה לפרטיות ולסוללה שלכם.

מאת: מערכת ישראל טיימס
הבינה המלאכותית עוברת לגור בכיס: המהפכה השקטה של המודלים הקטנים

כבו את הנתונים הסלולריים. נתקו את ה-Wi-Fi. עכשיו בקשו מהטלפון לתמלל הקלטה של פגישה, לסכם אותה לשלוש נקודות ולנסח תשובה מנומסת. במכשירים החדשים זה פשוט יעבוד: בלי קליטה, בלי ענן, בלי שמילה אחת תעזוב את המכשיר.

זו לא תקלה וזה לא קסם. זו אחת התמורות הגדולות והשקטות של תעשיית הטכנולוגיה בעשור הנוכחי: בזמן שהכותרות עסוקות במודלי ענק שמעסיקים חוות שרתים שלמות, ההתקדמות המעניינת באמת מתרחשת דווקא בכיוון ההפוך — מודלים שהולכים ומצטמקים, נדחסים ומזוקקים, עד שהם נכנסים לתוך שבב בגודל ציפורן.

בתעשייה קוראים לזה on-device AI: בינה מלאכותית שרצה על המכשיר עצמו. היא כבר יושבת בטלפון שלכם, ועושה בשקט דברים שרובנו עדיין בטוחים שקורים בענן.

ענן מול כיס: שתי דרכים להריץ בינה מלאכותית

כששולחים שאלה ל-ChatGPT, הטקסט יוצא למסע. הוא נוסע לחוות שרתים, מחכה בתור, נטחן במודל עם מאות מיליארדי פרמטרים — אותם "ברגים" מתמטיים שמהם בנוי הידע של המערכת — וחוזר כתשובה. זה מרשים, אבל המסע הזה עולה כסף, זמן וחשמל, והוא מסתיים תמיד באותה נקודה מטרידה: הנתונים שלכם התארחו אצל מישהו אחר.

הדרך השנייה הפוכה בתכלית: מודל שפה קטן — SLM, ראשי תיבות של Small Language Model — שמותקן על הטלפון ורץ על השבב שלו. כמה קטן? IBM מגדירה מודלים כאלה כבעלי כמה מיליונים עד כמה מיליארדים של פרמטרים, לעומת מאות מיליארדים ואף טריליונים במודלי הענק. חוקרי NVIDIA הציעו במאמר מיוני 2025 הגדרה מעשית יותר: כל מודל שנכנס למכשיר צרכני רגיל ועונה מהר מספיק למשתמש אחד — ובפועל, נכון ל-2025, רוב מה שמתחת ל-10 מיליארד פרמטרים.

הפער הכלכלי בין שתי הדרכים דרמטי. לפי אותו מאמר של NVIDIA, הפעלת מודל של 7 מיליארד פרמטרים זולה פי 10 עד פי 30 — בזמן תגובה, באנרגיה ובכוח מחשוב — מהפעלת מודל של 70 עד 175 מיליארד פרמטרים. מנכ"ל IBM, ארווינד קרישנה, העריך שמעבר למודלים ייעודיים קטנים חתך את עלויות ההרצה של המודלים בארגונים עד פי 30. ומחקר שהציגה קוואלקום בספטמבר 2025, שהשווה הרצת מודלים זהים על Galaxy S24 מול שרתי ענן, מצא חיסכון של עד 95 אחוז באנרגיה ועד 88 אחוז בפליטות פחמן לטובת הטלפון — גם אם החוקרים סייגו ואמרו שמדובר בהשוואה ראשונית בהיקף מוגבל.

ויש את הזמן. סקירה אקדמית מקיפה מ-2024 העריכה שמודל ענן כמו GPT-4 מייצר טוקן — יחידת הטקסט הבסיסית של מודלי שפה, בערך שלושת רבעי מילה — בכ-200 אלפיות השנייה, קצב שמודלים קטנים על שבבים חדשים כבר משתווים אליו ואף עוקפים אותו, בלי לצאת מהמכשיר ובלי תלות באיכות הקליטה.

ומעל הכול מרחפת הפרטיות: כשהמודל רץ על השבב, הקלטת השיחה עם הרופאה, ההתכתבות עם עורך הדין ותמונות הילדים פשוט לא עוזבות את הטלפון. זו לא הבטחה שיווקית שדורשת אמון — זו ארכיטקטורה.

מה זה NPU, ולמה כל שבב חדש מתהדר בו?

את המהפכה הזאת מניע רכיב שרוב הקונים למדו לזהות רק לאחרונה: NPU, ראשי תיבות של Neural Processing Unit — יחידת עיבוד עצבית. אם המעבד הראשי הוא אולר שוויצרי והמעבד הגרפי הוא צייר מהיר, ה-NPU הוא פועל פס ייצור שמתמחה בפעולה אחת: כפל מטריצות, החישוב שממנו עשויות רשתות עצביות — בהיקפים עצומים ובצריכת חשמל זעירה.

הרעיון עצמו ותיק. כבר ב-2017 שתלה אפל בשבב A11 Bionic של iPhone X "מנוע עצבי" דו-ליבתי שביצע עד 600 מיליארד פעולות בשנייה והפעיל את זיהוי הפנים של Face ID. אבל מה שהתחיל כקוריוז לזיהוי פרצופים הפך לזירת התחרות המרכזית של תעשיית השבבים. מיקרוסופט קבעה במאי 2024 רף כניסה למחשבי ה-Copilot+ שלה: NPU שמבצע לפחות 40 טריליון פעולות בשנייה (TOPS). קוואלקום חשפה באוקטובר 2024 את שבב הדגל Snapdragon 8 Elite, עם NPU מהיר ב-45 אחוז מקודמו שמריץ מודלים קטנים בקצב של יותר מ-70 טוקנים בשנייה — מהר בהרבה מקצב הקריאה של כולנו. בספטמבר 2025 הגיע היורש, Snapdragon 8 Elite Gen 5, עם קפיצה נוספת של 37 אחוז בביצועי ה-NPU; זה השבב שמניע את ה-Galaxy S26 Ultra של סמסונג, שהגיע למדפים במרץ האחרון. וגוגל בנתה את שבב Tensor G5 של סדרת Pixel 10 סביב הדור החדש של Gemini Nano, שרץ עליו — לפי גוגל — מהר פי 2.6 מאשר בדור הקודם.

מלחמת המגה-פיקסלים של שנות האלפיים התחלפה. שבבים כבר לא נמכרים לפי מהירות המעבד, אלא לפי כמות הבינה שהם מסוגלים להריץ בלי כרטיס SIM.

איך דוחסים מוח של מיליארדי פרמטרים לתוך טלפון?

מודל שפה בגודל מלא לא נכנס לשום טלפון: 7 מיליארד פרמטרים ברזולוציה מלאה תופסים עשרות ג'יגה-בייט של זיכרון. הדחיסה נעשית בשלושה טריקים עיקריים.

הראשון: קוונטיזציה (quantization). במקום לשמור כל פרמטר כמספר עשרוני מדויק, מעגלים אותו לייצוג חסכוני — הגרסה המתמטית של דחיסת תמונת RAW ל-JPEG. גוגל דיווחה במאי 2025 שדחיסה ל-4 ביט מקטינה את המודלים שלה פי 2.5 עד פי 4, תוך שיפור בזמני התגובה ובצריכת הזיכרון. אפל הרחיקה לכת: המודל שרץ על האייפון אומן מראש לעבוד עם משקולות של 2 ביט בלבד. עד כמה זה עובד? חוקרי מיקרוסופט הדגימו עוד באפריל 2024 את Phi-3-mini — מודל של 3.8 מיליארד פרמטרים שאחרי דחיסה ל-4 ביט תופס 1.8 ג'יגה-בייט בלבד, ורץ על iPhone 14 בקצב של יותר מ-12 טוקנים בשנייה. בלי רשת, על טלפון מ-2022.

השני: זיקוק ידע (distillation). מודל ענק משמש "מורה" שמאמן מודל קטן לחקות את תשובותיו, והתלמיד יורש חלק מפתיע מהיכולות במשקל קטן פי עשרות. בשיטה הזאת, בשילוב גיזום (pruning) של רשתות קיימות, בנתה מטא את הגרסאות הקטנות של Llama 3.2 — מיליארד אחד ו-3 מיליארד פרמטרים — שתוכננו מהיום הראשון לרוץ על שבבי קוואלקום ומדיה-טק.

והשלישי: ארכיטקטורות שנולדו לחיים בתוך מכשיר. Gemma 3n של גוגל, שיצאה ביוני 2025, מחזיקה 8 מיליארד פרמטרים אבל מתנהגת בזיכרון כמו מודל של 4 מיליארד ומסתפקת בכ-3 ג'יגה-בייט RAM — והיא מבינה טקסט, תמונות, אודיו ווידאו. גרסתה הקטנה מסתדרת עם 2 ג'יגה-בייט: פחות ממה שדורש דפדפן עם כמה כרטיסיות פתוחות.

מה הטלפון שלכם כבר עושה לבד, בלי שסיפרו לכם

המהפכה הזאת לא הגיעה בהכרזה חגיגית אחת אלא בטפטוף של יכולות, שרבות מהן כלל לא שווקו כ"בינה מלאכותית על המכשיר".

זה התחיל ברצינות בדצמבר 2023, כשגוגל דחפה את Gemini Nano ל-Pixel 8 Pro: אפליקציית ההקלטות קיבלה כפתור סיכום שעובד גם במצב טיסה, והמקלדת למדה להציע תשובות חכמות בוואטסאפ — הכול על השבב. חודש אחר כך הגיעה סמסונג עם Galaxy S24 ו-Live Translate: תרגום דו-כיווני של שיחות טלפון בזמן אמת, ב-13 שפות בעת ההשקה, שרץ כולו על המכשיר — גם כשהצד השני מדבר מטלפון קווי. באוקטובר 2024 הצטרפה אפל עם Apple Intelligence: כלי כתיבה, סיכומי התראות וניקוי אובייקטים מתמונות, שמאחוריהם מודל של כ-3 מיליארד פרמטרים שיושב באייפון עצמו. ובאוגוסט 2025 הציגה גוגל את Magic Cue ב-Pixel 10 — שכבה שצצה מעצמה עם פרטי ההזמנה כשחבר שואל בהודעה "מתי הטיסה שלך?", עוד לפני ששאלתם את הטלפון דבר.

השלב הבא כבר יצא לדרך: ביוני 2025 פתחה אפל את המודל המקומי שלה למפתחים חיצוניים דרך ה-Foundation Models framework, כך שכל אפליקציה יכולה לקבל ממנו סיכום, ניסוח או חילוץ מידע — בחינם, בלי שרת ובלי אינטרנט. המשמעות: בקרוב גם האפליקציות הקטנות בטלפון שלכם יחשבו לבד.

מי שקרא אצלנו על האלגוריתמים שמעצבים את ההחלטות שלנו יזהה כאן טוויסט מעניין: אותה הסקה סטטיסטית שפעם דרשה חוות שרתים — ומשלוח של הנתונים שלכם אליהן — מתרחשת עכשיו בדרך מהכיס לכף היד.

המחיר: מה מודל קטן לא יודע לעשות

לפני שמתאהבים, כדאי לומר ביושר מה מודל כיס לא יודע. פרמטרים הם ידע דחוס על העולם, וכשיש פחות מהם — יודעים פחות. מודל של 3 מיליארד פרמטרים לא מכיר את ויקיפדיה בעל פה, וכששואלים אותו שאלת ידע פתוחה, הסיכוי שלו להמציא עובדות גבוה משמעותית מזה של מודל ענק. אפל עצמה מנסחת זאת בלי להתבייש: המודל המקומי שלה, כך כתבו חוקרי החברה, לא תוכנן להיות צ'טבוט לשאלות ידע כלליות. הוא אומן למשימות תחומות — סיכום, ניסוח, חילוץ פרטים, שיחה קצרה — ושם הוא מצטיין.

לכן כל היצרניות בנו ארכיטקטורה היברידית. אצל אפל, בקשות שגדולות על המודל המקומי עוברות ל-Private Cloud Compute — ענן ייעודי שאפל מתחייבת שאינו שומר נתונים, עם מנגנונים קריפטוגרפיים שנועדו להוכיח זאת. אצל סמסונג אפשר להפעיל בהגדרות Galaxy AI את המתג "עיבוד נתונים במכשיר בלבד" — ואז חלק מהיכולות, כמו עריכה גנרטיבית של תמונות, פשוט נכבות. הפשרה גלויה: או מקסימום יכולת, או מקסימום פרטיות.

ויש גם מחיר פיזי. מודל שרץ מקומית מחמם את השבב ושותה מהסוללה, ולכן היצרניות שומרות את היכולות המלאות לדגמים חזקים עם שפע זיכרון — אחת הסיבות לכך שהיכולות החדשות מגיעות קודם כול למכשירי הדגל.


קל לפספס את גודל הרגע, דווקא מפני שהוא לא מלווה בזיקוקים. אף אחד לא עומד על במה ומכריז "מהיום הטלפון שלכם חושב לבד"; זה מגיע כעדכון תוכנה, ככפתור קטן וחדש באפליקציית ההקלטות. אבל המסלול ברור: הבינה המלאכותית עוברת את מה שעבר ה-GPS — ממערכת יקרה ששייכת לצבאות ולמעבדות, לתשתית שקופה שאף אחד כבר לא מקדיש לה מחשבה.

בפעם הבאה שתחליפו מכשיר, שווה לשאול לא רק כמה מגה-פיקסלים יש למצלמה, אלא איזה מודל גר בפנים ומה הוא יודע לעשות בלי רשת. ולמי שחי בעברית יש סיבה נוספת לעקוב מקרוב: נכון לאפריל 2026, עברית עדיין איננה ברשימת השפות הנתמכות של Apple Intelligence — תזכורת לכך שגם המהפכות השקטות ביותר מגיעות אלינו באיחור אופנתי.

אבל הן מגיעות. והפעם, כשהן יגיעו, הן יגורו אצלכם בכיס — לא בענן של מישהו אחר.

שאלות ותשובות

האם בינה מלאכותית על המכשיר באמת בטוחה יותר לפרטיות?

ביסודו של דבר, כן: כשהמודל רץ על השבב, הנתונים לא נשלחים לשרת חיצוני — ההגנה נובעת מהארכיטקטורה, לא ממדיניות שאפשר לשנות. אבל בפועל רוב המכשירים עובדים במצב היברידי, שבו בקשות כבדות עוברות לענן. מי שרוצה ודאות צריך לבדוק את ההגדרות: במכשירי סמסונג יש מתג ייעודי לעיבוד במכשיר בלבד, ואפל מפרטת אילו בקשות נשארות מקומיות ואילו עוברות ל-Private Cloud Compute. וחשוב לזכור: אפליקציות צד שלישי כמו ChatGPT ממשיכות לעבוד מול הענן כרגיל.

למה המודל בטלפון טועה יותר מ-ChatGPT?

כי הוא קטן ממנו פי עשרות ואף מאות. מודל עם פחות פרמטרים מחזיק פחות ידע דחוס על העולם, ולכן בשאלות ידע פתוחות הוא מועד יותר להמצאות. המודלים המקומיים מכוונים למשימות תחומות — תמלול, סיכום, תרגום, ניסוח — ושם הפער מול מודלי הענק מצטמצם מאוד. אפל מגדירה זאת במפורש: המודל שבמכשיר לא נועד לשמש צ'טבוט לשאלות ידע כלליות.

האם צריך טלפון חדש בשביל זה?

בשביל החבילות המלאות — בינתיים כן. Apple Intelligence דורשת iPhone 15 Pro ומעלה, והיכולות הבולטות של גוגל וסמסונג מושקות תחילה במכשירי דגל עם NPU חזק ושפע זיכרון. אבל הרף יורד מהר: Gemma 3n המולטימודאלית מסתפקת ב-2 עד 3 ג'יגה-בייט זיכרון, ו-Phi-3-mini רץ כבר ב-2024 על iPhone 14 מ-2022. סביר להניח שבתוך שנתיים-שלוש גם מכשירי ביניים יריצו מודלים מקומיים מרשימים.

מקורות

  1. Introducing Apple's On-Device and Server Foundation Models — Apple Machine Learning Research, יוני 2024. machinelearning.apple.com
  2. Updates to Apple's On-Device and Server Foundation Language Models — Apple Machine Learning Research, יוני 2025. machinelearning.apple.com
  3. Apple Intelligence is available today on iPhone, iPad, and Mac — Apple Newsroom, אוקטובר 2024. apple.com
  4. The future is here: iPhone X — Apple Newsroom, ספטמבר 2017. apple.com
  5. How to get Apple Intelligence — Apple Support. support.apple.com
  6. Private Cloud Compute: A new frontier for AI privacy in the cloud — Apple Security Research, יוני 2024. security.apple.com
  7. Snapdragon 8 Elite Gen 5, the World's Fastest Mobile System-on-a-Chip — Qualcomm, ספטמבר 2025. qualcomm.com
  8. Shifting AI inference from the cloud to your phone can reduce AI costs — Qualcomm OnQ, ספטמבר 2025. qualcomm.com
  9. Snapdragon 8 Elite: more than 70 tokens per second on-device — Snapdragon (הודעה רשמית ב-X), אוקטובר 2024. x.com
  10. On-device small language models with multimodality, RAG, and Function Calling — Google Developers Blog, מאי 2025. developers.googleblog.com
  11. Introducing Gemma 3n: The developer guide — Google Developers Blog, יוני 2025. developers.googleblog.com
  12. Pixel 8 Pro — the first smartphone with AI built in — is now running Gemini Nano — Google (The Keyword), דצמבר 2023. blog.google
  13. Pixel 10 introduces new chip, Tensor G5 — Google (The Keyword), אוגוסט 2025. blog.google
  14. Breaking Language Barriers: AI-Powered Live Translate on Galaxy S24 Ultra — Samsung Global Newsroom, ינואר 2024. news.samsung.com
  15. Samsung Unveils Galaxy S26 Series — Samsung Global Newsroom, פברואר 2026. news.samsung.com
  16. Use features with Galaxy AI on your Galaxy phone — Samsung Support. samsung.com
  17. What are Small Language Models (SLM)? — IBM Think. ibm.com
  18. Meet the AI-first phones powered by small models — IBM Think News. ibm.com
  19. Small Language Models are the Future of Agentic AI — NVIDIA Research (arXiv), יוני 2025. arxiv.org
  20. Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone — Microsoft (arXiv), אפריל 2024. arxiv.org
  21. Llama 3.2: Revolutionizing edge AI and vision with open models — Meta AI, ספטמבר 2024. ai.meta.com
  22. Introducing Copilot+ PCs — Microsoft, מאי 2024. blogs.microsoft.com
  23. On-Device Language Models: A Comprehensive Review — arXiv, ספטמבר 2024. arxiv.org