GUIDENEW

איך להשתמש ב-API של OpenAI

מדריך מעשי להפעלת ה-API של OpenAI: יצירת מפתח, קריאה ראשונה בקוד, בחירת מודל לפי תקציב, והגבלת הוצאות לפני שהן יוצאות משליטה.

מערכת בינה AI טופמדריכים8 בספטמבר 20263 min2 sources
מסך קוד כהה עם קריאת API זוהרת בסגול וטרמינל מציג תגובה
מסך קוד כהה עם קריאת API זוהרת בסגול וטרמינל מציג תגובה

יש הבדל מהותי בין להקליד שאלה בממשק של ChatGPT לבין לשלוח את אותה בקשה דרך ה-API: בממשק המחיר קבוע וחודשי, וב-API כל קריאה נספרת בטוקנים ומחויבת בנפרד. מי שעובר בין השניים בלי להבין את ההבדל הזה מגלה את זה בדרך הכי לא נעימה - בחשבונית.

שלב 1 - מפתח API

נכנסים ל-platform.openai.com, פותחים חשבון נפרד מזה של ChatGPT הרגיל (הם מתחברים לאותו אימייל אבל מחויבים בנפרד), ויוצרים מפתח בעמוד ה-API keys. המפתח מוצג פעם אחת בלבד - שומרים אותו במקום מאובטח, לא בקוד עצמו ולא בקובץ שמועלה ל-GitHub.

שלב 2 - התקנת הספרייה

pip install openai

או ב-Node:

npm install openai

שלב 3 - קריאה ראשונה

OpenAI ממליצה כיום על Responses API כברירת מחדל לפרויקטים חדשים - היא תומכת בכלים מובנים, ניהול מצב בין קריאות, וניצול טוב יותר של מטמון שמוזיל עלות בקריאות חוזרות. Chat Completions הישן עדיין עובד ולא הוצא משימוש, אבל למי שמתחיל מאפס עדיף להתחיל ישר מה-API החדש.

from openai import OpenAI
client = OpenAI(api_key="המפתח_שלך")

response = client.responses.create(
    model="gpt-5.6-terra",
    input="סכם ב-3 משפטים מה ההבדל בין RAG לבין fine-tuning"
)
print(response.output_text)

טיפול בשגיאות בסיסי

קריאות ל-API נכשלות מדי פעם - עומס זמני בצד השרת, חריגה ממכסת קצב (rate limit), או ניתוק רשת. קוד שרץ בפרודקשן צריך ניסיון חוזר עם השהיה הולכת וגדלה, לא לולאה שמנסה שוב מיד:

import time
for attempt in range(3):
    try:
        response = client.responses.create(model="gpt-5.6-terra", input="...")
        break
    except Exception as e:
        if attempt == 2:
            raise
        time.sleep(2 ** attempt)

שלוש נסיונות עם השהיה של שנייה, שתיים וארבע שניות מספיקים לרוב התקלות הזמניות, ובמקביל מונעים מצב שבו כשל אמיתי (כמו מפתח שגוי) גורם ללולאה אינסופית של קריאות מיותרות.

שלב 4 - לבחור מודל לפי המשימה, לא לפי השם המוכר

מודלמחיר לכל מיליון טוקנים (קלט/פלט)מתאים ל
gpt-6-astra10$ / 50$משימות מורכבות שדורשות דיוק מקסימלי
gpt-5.6-sol4$ / 20$עבודה יומיומית ברמה גבוהה
gpt-5.6-terra2$ / 12$רוב האפליקציות בפרודקשן - איזון עלות-איכות
gpt-5.6-luna0.20$ / 1.20$סיווג, תיוג, משימות פשוטות בנפח גבוה

מחירים נכונים ל-8.9.2026 לפי עמוד המחירים הרשמי. הבחירה הנכונה כמעט אף פעם לא המודל היקר ביותר - משימה כמו סיווג טקסט או חילוץ שדות מ-JSON עובדת מצוין על gpt-5.6-luna במחיר זעום ביחס ל-gpt-6-astra.

מסך קוד כהה עם קריאת API זוהרת בסגול וטרמינל מציג תגובה

איך יודעים שהתוצאה טובה

  • הקריאה חוזרת בזמן סביר (בדרך כלל שניות בודדות למודלים הקטנים, עד עשרות שניות למודלים עם reasoning עמוק).
  • עלות בפועל תואמת את מה שחישבתם מראש - שווה לבדוק בלוח הבקרה של OpenAI אחרי כמה עשרות קריאות, לא לחכות לסוף החודש.
  • הפלט לא משתנה דרמטית בין קריאה לקריאה לאותה בקשה - אם כן, שווה להוריד את פרמטר ה-temperature.

איפה זה נשבר

חוסר הגבלת שימוש הוא הטעות היקרה ביותר: בלי הגדרת תקציב חודשי בלוח הבקרה, לולאה בקוד שקוראת ל-API בלי הפסקה (למשל בגלל בדיקת שגיאה שגויה שממשיכה לנסות שוב) יכולה לצבור חיוב גדול תוך שעות. גם מודלים עם reasoning עמוק (כמו o3) יכולים לצרוך הרבה יותר טוקני פלט ממה שנראה בתשובה עצמה, כי חלק מה"חשיבה" נספר בעלות גם אם לא מוצג. ולבסוף - מפתח API שדלף לקוד ציבורי ב-GitHub נמצא ומנוצל תוך דקות על ידי בוטים; OpenAI סורקת ריפואים ציבוריים ולעיתים מבטלת מפתחות שדלפו אוטומטית, אבל לא תמיד מספיק מהר.

מפתח API התקנת ספרייה קריאה ראשונה תקרת הוצאה
ארבעת השלבים מהרשמה ועד קריאה ראשונה מוגנת בתקציב

מה לנסות עכשיו

לפני שכותבים קוד בפרודקשן - קובעים בלוח הבקרה תקרת הוצאה חודשית (Usage limits), ורק אז מריצים את הדוגמה למעלה עם gpt-5.6-luna או gpt-5-nano הזול. ברגע שהתהליך עובד ויציב, עוברים למודל היקר יותר רק אם המשימה בפועל דורשת את זה - לא כברירת מחדל.

שווה גם להרגיל את עצמכם לבדוק את שדה ה-usage שמוחזר עם כל תשובה - הוא מציג בדיוק כמה טוקני קלט ופלט נספרו בקריאה הספציפית הזו. הרגל של לבדוק את זה בכמה קריאות ראשונות נותן תחושה מדויקת של העלות בפועל, הרבה לפני שמגיעים לחשבונית בסוף החודש. מי שמדלג על השלב הזה בדרך כלל מגלה את המספר האמיתי מאוחר מדי.

שאלות נפוצות

האם צריך לעבור ל-Responses API אם כבר עובדים עם Chat Completions?

לא באופן מיידי - Chat Completions לא הוצא משימוש ועדיין מתאים למשימות טקסט פשוטות. OpenAI ממליצה על Responses API לפרויקטים חדשים, בעיקר כאלה עם כלים וזיכרון בין קריאות.

למה קריאה מה-API שונה ממה שרואים בממשק הצ׳אט?

בממשק יש הגבלות שימוש שכלולות במחיר המנוי החודשי. ב-API משלמים לפי טוקן על כל קריאה, ולכן אותה שאלה יכולה לעלות כמעט כלום או כמה סנטים, תלוי באורך הקלט והפלט ובמודל שנבחר.

SOURCES

  1. OpenAI API - Pricing · נבדק 8 בספטמבר 2026
  2. OpenAI - Migrate to the Responses API · נבדק 8 בספטמבר 2026

קשור לזה