Home »
Blog »
AI/ML Engineer সিরিজ » Series 07 » Episode 08
LLM কী? GPT, Llama, Mistral, Claude, Gemini — tokens, context window, inference
training ≠ inference (Series 07, Episode 08)
🟡 INTERMEDIATE
Series 07 — NLP, Transformers ও LLM
Episode 08 / 08
📑 এই পর্বে যা যা আছে
- ১. গল্প: ChatGPT আসলে ভেতরে কী করছে?
- ২. সমস্যা: LLM নিয়ে গুচ্ছ ভুল ধারণা
- ৩. LLM কী — এক বাক্যে
- ৪. তিন স্তরে LLM
- ৫. "পরের token" — LLM-এর একমাত্র কাজ
- ৬. Token আবার (word নয়!) ও খরচ
- ৭. Context window কী ও কেন গুরুত্বপূর্ণ
- ৮. Training ≠ Inference (সবচেয়ে জরুরি পার্থক্য)
- ৯. LLM পরিবার: GPT, Llama, Mistral, Claude, Gemini
- ১০. Code: একটা LLM API call
- ১১. Temperature ও sampling — কেন উত্তর বদলায়
- ১২. Boss Question ও AI Engineer perspective
- ১৩. Job Requirement Decoder: "LLM"
- ১৪. সাধারণ ভুল
- ১৫. Interview Prep
- ১৬. হাতে-কলমে ও Project Connection
- ১৭. সারসংক্ষেপ ও পরবর্তী পর্ব
🧩 ১. গল্প: ChatGPT আসলে ভেতরে কী করছে?
Rahim এখন Transformer, attention, Hugging Face সব বোঝে। কিন্তু তার মনে সবচেয়ে বড় প্রশ্ন — "ChatGPT
যখন আমার সাথে এত সুন্দর কথা বলে, সে কি সত্যিই 'ভাবছে'? নাকি ভেতরে অন্য কিছু হচ্ছে?"
Rahim: "আপা, LLM কি সব উত্তর মুখস্থ করে রেখেছে? নাকি প্রশ্ন বুঝে নতুন করে ভাবছে?"
Maya: "দুটোই না! LLM আসলে একটাই কাজ করে — 'এতক্ষণের লেখা দেখে পরের শব্দ (token) কী হওয়া সবচেয়ে
সম্ভব?' এটা বারবার করে। মুখস্থও না, মানুষের মতো ভাবাও না — এটা একটা অসম্ভব ভালো
next-token predictor। এই একটা সত্য বুঝলে LLM নিয়ে অর্ধেক ভুল ধারণা দূর হয়ে যায়।"
❓ ২. সমস্যা: LLM নিয়ে গুচ্ছ ভুল ধারণা
একজন AI Engineer হিসেবে আপনাকে এই ভুল ধারণাগুলো ভাঙতে হবে — নিজের ভেতরে ও stakeholder-দের মধ্যে:
- "LLM সব সত্য জানে" — না, সে সম্ভাব্য শব্দ predict করে; ভুলও বলতে পারে (hallucination)।
- "LLM database থেকে খুঁজে আনে" — না, তার আলাদা কোনো live database নেই (RAG ছাড়া)।
- "LLM চালানো মানে training" — না, ব্যবহার করা = inference; training সম্পূর্ণ আলাদা।
- "LLM মানুষের মতো বোঝে" — সে pattern শেখে, চেতনা নেই।
🧠 ৩. LLM কী — এক বাক্যে
LLM (Large Language Model) হলো একটা বিশাল (কোটি-শত কোটি parameter) decoder-only
Transformer, যা অসংখ্য text-এ train হয়ে শিখেছে "এতক্ষণের text-এর পর সবচেয়ে সম্ভাব্য পরের token কোনটা" —
আর এই একটা ক্ষমতা বারবার প্রয়োগ করে সে বাক্য, অনুচ্ছেদ, code, উত্তর — সব তৈরি করে।
মনে রাখুন গত পর্বগুলোর ধারাবাহিকতা: শব্দ (embedding) → ক্রম/সম্পর্ক (attention) → Transformer (decoder-only)
→ বিশাল scale + বিশাল data = LLM। LLM কোনো নতুন জাদু নয়, এটা আমরা যা শিখেছি তারই বিশাল রূপ।
🪜 ৪. তিন স্তরে LLM
Level 1 — সহজ intuition:
আপনার ফোনের keyboard যেমন পরের শব্দ suggest করে — LLM সেটারই অসম্ভব শক্তিশালী রূপ। শুধু একটা-দুটো শব্দ নয়,
সে পুরো অনুচ্ছেদ, যুক্তি, code সাজিয়ে দিতে পারে, কারণ সে ইন্টারনেটের বিপুল text থেকে ভাষার pattern শিখেছে।
Level 2 — technical:
LLM input text-কে token-এ ভাঙে (S07E01), প্রতিটা token embedding + positional encoding পায়, বহু
Transformer decoder layer-এর মধ্য দিয়ে যায়, শেষে পুরো vocabulary-র উপর একটা probability distribution
দেয় — সেখান থেকে পরের token বাছা হয়, তারপর সেটা input-এ যোগ করে আবার — এভাবে autoregressive-ভাবে চলে।
Level 3 — AI Engineer perspective:
বেশিরভাগ AI Engineer LLM train করে না — তারা API/pretrained model দিয়ে application বানায়
(prompting, RAG, agents — Series 08)। তাই আপনার মূল দক্ষতা: token/খরচ/latency/context window বোঝা,
সঠিক model বাছা, আর hallucination সামলানো — মডেলের ভেতরের গণিত নয়।
🔮 ৫. "পরের token" — LLM-এর একমাত্র কাজ
Input: "বাংলাদেশের রাজধানী"
|
v (LLM পুরো vocabulary-তে সম্ভাবনা দেয়)
"ঢাকা" : 0.92
"হলো" : 0.04
"একটি" : 0.02
...
|
v (সবচেয়ে সম্ভাব্য/sample করা token বাছে)
Output token: "ঢাকা"
|
v (এটা input-এ যোগ করে আবার শুরু)
"বাংলাদেশের রাজধানী ঢাকা" -> পরের token -> ...
এই একটা loop — "পরের token predict, যোগ করো, আবার" — বারবার চলে যতক্ষণ না উত্তর শেষ হয়। এটাকে বলে
autoregressive generation।
🎟️ ৬. Token আবার (word নয়!) ও খরচ
S07E01-এ শিখেছিলাম token ≠ word। এটা এখানে টাকার সাথে জড়িত: LLM API সাধারণত token অনুযায়ী
টাকা নেয় (input + output উভয়)। তাই খরচ হিসাব করতে token গুনতে জানতে হবে।
মোটামুটি হিসাব: ইংরেজিতে ১ শব্দ ≈ ১.৩ token; বাংলায় প্রায়ই বেশি (কারণ বেশিরভাগ tokenizer ইংরেজি-ঘেঁষা)।
মানে একই কাজ বাংলায় করলে token বেশি লাগে → খরচ ও latency বেশি। বাংলা AI product বানানোর সময় এটা বাস্তব বিবেচনা।
🪟 ৭. Context window কী ও কেন গুরুত্বপূর্ণ
Context window = LLM একবারে কত token "দেখতে" পারে (input + output মিলিয়ে)। যেমন
৪,০০০ / ৮,০০০ / ১,২৮,০০০ token। এর বাইরের কিছু model "ভুলে যায়" — কারণ attention-এর n² খরচ (S07E05) দীর্ঘ
context-কে দামি করে।
Context window = 8000 token
[ system prompt ][ chat history ][ আপনার document ][ প্রশ্ন ][ উত্তরের জায়গা ]
<-------------------- সব মিলিয়ে ≤ 8000 token -------------------->
খুব বড় document পুরো এখানে আঁটবে না -> তাই RAG দরকার (S08)!
ঠিক এই সীমার কারণেই আমরা কোম্পানির ৫ লাখ PDF সরাসরি LLM-এ দিতে পারি না — এখান থেকেই
RAG-এর প্রয়োজন জন্ম নেয় (Series 08)।
⚖️ ৮. Training ≠ Inference (সবচেয়ে জরুরি পার্থক্য)
Training (model বানানো)
• বিশাল data-তে parameter শেখানো
• শত/হাজার GPU, সপ্তাহ-মাস
• লক্ষ-কোটি ডলার খরচ
• OpenAI/Meta/Google করে
• একবার (বা মাঝেমধ্যে) হয়
Inference (model ব্যবহার)
• trained model-এ prompt দিয়ে উত্তর নেওয়া
• কয়েক সেকেন্ড, তুলনায় সস্তা
• API call বা এক GPU-তে চলে
• আমরা (AI Engineer) করি
• প্রতিবার ব্যবহারে হয়
মনে রাখুন: "LLM দিয়ে app বানানো" মানে প্রায় সবসময় inference — training নয়।
এই পার্থক্যটা interview-তে বারবার আসে, আর এটা AI ≠ ML, LLM app ≠ model training-এর মতোই মৌলিক।
👨👩👧 ৯. LLM পরিবার: GPT, Llama, Mistral, Claude, Gemini
| Model | বানায় | বিশেষত্ব |
| GPT (4o ইত্যাদি) | OpenAI | closed, API; সবচেয়ে জনপ্রিয়, শক্তিশালী general model |
| Claude | Anthropic | closed, API; দীর্ঘ context, নিরাপত্তা-কেন্দ্রিক |
| Gemini | Google | closed, API; multimodal (text+image) |
| Llama | Meta | open-weight — নিজে host করা যায়, privacy-বান্ধব |
| Mistral | Mistral AI | open-weight — ছোট, দক্ষ, সাশ্রয়ী |
গুরুত্বপূর্ণ পছন্দ: closed API (GPT/Claude/Gemini) — সহজ, কিন্তু data বাইরে যায় ও খরচ per-token;
বনাম open-weight (Llama/Mistral) — নিজে host করলে data ভেতরে থাকে (bKash/সরকারি data-র জন্য জরুরি),
কিন্তু GPU ও ops লাগে। এই trade-off AI Engineer-এর বাস্তব সিদ্ধান্ত।
💻 ১০. Code: একটা LLM API call
কেন API? — junior হিসেবে সবচেয়ে দ্রুত ও সস্তা শুরু; নিজে GPU-তে host করা পরে (S09)। উদাহরণটি OpenAI-শৈলীর,
কিন্তু ধারণা সব provider-এ একই।
# pip install openai
from openai import OpenAI
client = OpenAI() # API key environment variable-এ থাকবে
resp = client.chat.completions.create(
model="gpt-4o-mini", # ছোট, সস্তা -> শেখার জন্য ভালো
messages=[
{"role": "system",
"content": "You are a helpful career assistant for Bangladesh."},
{"role": "user",
"content": "junior ML engineer হতে কোন ৩টা skill আগে শিখব?"},
],
temperature=0.7,
)
print(resp.choices[0].message.content)
print("token খরচ:", resp.usage.total_tokens) # খরচ track করা জরুরি
লক্ষ্য করুন system ও user role — এটাই prompt engineering-এর ভিত্তি, যা আমরা
Series 08-এ বিস্তারিত দেখব। আর usage.total_tokens — production-এ খরচ monitor করার চাবি।
🌡️ ১১. Temperature ও sampling — কেন উত্তর বদলায়
একই প্রশ্নে LLM কখনো ভিন্ন উত্তর দেয় কেন? কারণ পরের token বাছার সময় সে সবসময় সবচেয়ে সম্ভাব্যটা নেয় না —
একটু randomness যোগ করে। এটা নিয়ন্ত্রণ করে temperature:
- temperature = 0: প্রায় deterministic; সবচেয়ে সম্ভাব্য token — factual/consistent কাজের জন্য।
- temperature ↑ (0.7–1.0): বেশি সৃজনশীল/বৈচিত্র্যময় — গল্প, brainstorming।
AI Engineer perspective: factual assistant/RAG-এ temperature কম রাখুন (consistency + কম hallucination);
creative writing-এ বেশি। এই একটা প্যারামিটার প্রায়ই output quality নাটকীয়ভাবে বদলে দেয়।
💼 ১২. Boss Question ও AI Engineer perspective
Boss: "আমরা কি নিজেদের একটা ChatGPT বানাব? খরচ কত?"
উত্তর: নিজে LLM train করা মানে কোটি কোটি টাকা ও শত GPU — আমাদের দরকার নেই এবং
অবাস্তব। আমাদের যা দরকার তা হলো একটা ভালো LLM (API বা open-weight Llama নিজে host) নিয়ে তার উপর আমাদের
নিজস্ব data ও logic বসিয়ে application বানানো — এটাই সস্তা, দ্রুত ও যথেষ্ট। খরচ মূলত token আর
(নিজে host করলে) GPU। এই সিদ্ধান্তই আমাদের বাজেট ঠিক করবে।
Must Know: LLM = next-token predictor, token/context window, training vs inference, একটা API call।
Good to Know: temperature/sampling, open vs closed model, খরচ হিসাব।
Learn Later: নিজে LLM host/serve করা, quantization, fine-tuning (S08E08, S09)।
🔎 ১৩. Job Requirement Decoder: "LLM"
JD-তে:
"Experience working with Large Language Models (LLMs)."
| প্রশ্ন | উত্তর |
| কী বোঝায়? | LLM কীভাবে কাজ করে বোঝা এবং API/model দিয়ে application বানাতে পারা। |
| কেন চায়? | GenAI feature (chatbot, summarize, extract) এখন প্রায় সব product-এ চাওয়া হয়। |
| কোন সমস্যা সমাধান করে? | ভাষা বোঝা/তৈরি করার কাজ — যা আগে অসম্ভব বা ব্যয়বহুল ছিল। |
| junior-এর কী জানা লাগে? | next-token idea, token/context window, training≠inference, একটা LLM API call করা। |
| এখনই কী master লাগে না? | LLM train করা, GPU serving optimization, ভেতরের গণিত। |
| GitHub-এ কীভাবে দেখাবেন? | একটা ছোট LLM-powered app (summarizer/Q&A) — token খরচ সহ। |
| Interview-তে? | "context window কী?", "training vs inference?", "open vs closed model?", "hallucination কী?" |
⚠️ ১৪. সাধারণ ভুল
ভুল ১: LLM-কে সত্যের উৎস ভাবা। → সে সম্ভাব্য token predict করে; ভুল/মিথ্যা (hallucination) দিতে পারে।
ভুল ২: LLM ব্যবহার = training ভাবা। → ব্যবহার = inference; training সম্পূর্ণ আলাদা ও ব্যয়বহুল।
ভুল ৩: token = word ধরে খরচ হিসাব। → token সাধারণত subword; বাংলায় বেশি লাগে।
ভুল ৪: context window অসীম ভাবা। → সীমিত; বড় document-এ RAG লাগে।
ভুল ৫: LLM আর embedding model গুলিয়ে ফেলা। → LLM generate করে, embedding model vector দেয় (S07E03)।
🎤 ১৫. Interview Prep
প্রশ্ন ১: LLM মূলত কী করে?
উত্তর: এতক্ষণের text দেখে সবচেয়ে সম্ভাব্য পরের token predict করে; এটা autoregressive-ভাবে
বারবার করে পুরো output তৈরি করে।
প্রশ্ন ২: Context window কী এবং কেন গুরুত্বপূর্ণ?
উত্তর: একবারে model কত token দেখতে পারে (input+output)। এর বাইরের তথ্য হারায়; তাই বড় document-এ RAG দরকার।
প্রশ্ন ৩: Training আর inference-এর পার্থক্য?
উত্তর: training = বিশাল খরচে parameter শেখানো (একবার); inference = trained model ব্যবহার করে উত্তর নেওয়া (প্রতিবার, সস্তা)।
প্রশ্ন ৪: Open-weight বনাম closed API model — কখন কোনটা?
উত্তর: data privacy/নিয়ন্ত্রণ লাগলে open-weight নিজে host; দ্রুত/সহজ শুরু ও কম ops চাইলে closed API।
✍️ ১৬. হাতে-কলমে ও Project Connection
১. একটা LLM API-তে temperature 0 আর 1.0-তে একই প্রশ্ন ৩ বার করে output-এর পার্থক্য দেখুন।
২. tiktoken (বা tokenizer) দিয়ে একটা বাংলা ও একটা ইংরেজি অনুচ্ছেদের token গুনে খরচ তুলনা করুন।
৩. নিজের ভাষায় লিখুন: কেন ৫ লাখ PDF সরাসরি context window-এ দেওয়া যায় না?
আমাদের flagship "Bangladesh Tech Career Assistant" এখন V6 (LLM)
পর্যায়ে ঢুকল — এটি এখন একজন ব্যবহারকারীর প্রশ্ন ("আমার এই skill আছে, কোন role target করব?") বুঝে
স্বাভাবিক ভাষায় পরামর্শ দিতে পারবে। কিন্তু context window-এর সীমা আমাদের সরাসরি পরের বড় লক্ষ্যে নিয়ে যাচ্ছে —
আমাদের নিজস্ব JD/knowledge base যুক্ত করা, অর্থাৎ RAG।
📌 ১৭. সারসংক্ষেপ ও পরবর্তী পর্ব
এই পর্বে (এবং পুরো Series 07-এ) শিখলাম:
✓ LLM = বিশাল decoder-only Transformer, মূল কাজ next-token prediction
✓ token ≠ word; খরচ ও context window token-এ মাপা হয়
✓ context window সীমিত — তাই বড় document-এ RAG লাগে
✓ training ≠ inference — আমরা মূলত inference/application বানাই
✓ GPT/Claude/Gemini (closed API) বনাম Llama/Mistral (open-weight) — trade-off
✓ temperature output-এর randomness নিয়ন্ত্রণ করে
✓ পুরো Series 07-এর যাত্রা: tokenization → TF-IDF → embeddings → RNN/LSTM → attention → Transformer → LLM
পরবর্তী: Series 08 — Generative AI Engineering। এবার তত্ত্ব থেকে বাস্তব application —
prompt engineering, embeddings-based search, vector database, আর সেই বহু-আলোচিত RAG: কীভাবে
LLM-কে আপনার কোম্পানির নিজস্ব document দিয়ে "কথা বলাবেন"। এটাই আজকের বাজারের সবচেয়ে চাহিদাসম্পন্ন skill।