LLM কী? GPT, Llama, Mistral, Claude, Gemini — tokens, context window, inference

training ≠ inference (Series 07, Episode 08)

🟡 INTERMEDIATE Series 07 — NLP, Transformers ও LLM Episode 08 / 08

📑 এই পর্বে যা যা আছে

🧩 ১. গল্প: ChatGPT আসলে ভেতরে কী করছে?

Rahim এখন Transformer, attention, Hugging Face সব বোঝে। কিন্তু তার মনে সবচেয়ে বড় প্রশ্ন — "ChatGPT যখন আমার সাথে এত সুন্দর কথা বলে, সে কি সত্যিই 'ভাবছে'? নাকি ভেতরে অন্য কিছু হচ্ছে?"

Rahim: "আপা, LLM কি সব উত্তর মুখস্থ করে রেখেছে? নাকি প্রশ্ন বুঝে নতুন করে ভাবছে?"

Maya: "দুটোই না! LLM আসলে একটাই কাজ করে — 'এতক্ষণের লেখা দেখে পরের শব্দ (token) কী হওয়া সবচেয়ে সম্ভব?' এটা বারবার করে। মুখস্থও না, মানুষের মতো ভাবাও না — এটা একটা অসম্ভব ভালো next-token predictor। এই একটা সত্য বুঝলে LLM নিয়ে অর্ধেক ভুল ধারণা দূর হয়ে যায়।"

২. সমস্যা: LLM নিয়ে গুচ্ছ ভুল ধারণা

একজন AI Engineer হিসেবে আপনাকে এই ভুল ধারণাগুলো ভাঙতে হবে — নিজের ভেতরে ও stakeholder-দের মধ্যে:

🧠 ৩. LLM কী — এক বাক্যে

LLM (Large Language Model) হলো একটা বিশাল (কোটি-শত কোটি parameter) decoder-only Transformer, যা অসংখ্য text-এ train হয়ে শিখেছে "এতক্ষণের text-এর পর সবচেয়ে সম্ভাব্য পরের token কোনটা" — আর এই একটা ক্ষমতা বারবার প্রয়োগ করে সে বাক্য, অনুচ্ছেদ, code, উত্তর — সব তৈরি করে।

মনে রাখুন গত পর্বগুলোর ধারাবাহিকতা: শব্দ (embedding) → ক্রম/সম্পর্ক (attention) → Transformer (decoder-only) → বিশাল scale + বিশাল data = LLM। LLM কোনো নতুন জাদু নয়, এটা আমরা যা শিখেছি তারই বিশাল রূপ।

🪜 ৪. তিন স্তরে LLM

Level 1 — সহজ intuition:
আপনার ফোনের keyboard যেমন পরের শব্দ suggest করে — LLM সেটারই অসম্ভব শক্তিশালী রূপ। শুধু একটা-দুটো শব্দ নয়, সে পুরো অনুচ্ছেদ, যুক্তি, code সাজিয়ে দিতে পারে, কারণ সে ইন্টারনেটের বিপুল text থেকে ভাষার pattern শিখেছে।

Level 2 — technical:
LLM input text-কে token-এ ভাঙে (S07E01), প্রতিটা token embedding + positional encoding পায়, বহু Transformer decoder layer-এর মধ্য দিয়ে যায়, শেষে পুরো vocabulary-র উপর একটা probability distribution দেয় — সেখান থেকে পরের token বাছা হয়, তারপর সেটা input-এ যোগ করে আবার — এভাবে autoregressive-ভাবে চলে।

Level 3 — AI Engineer perspective:
বেশিরভাগ AI Engineer LLM train করে না — তারা API/pretrained model দিয়ে application বানায় (prompting, RAG, agents — Series 08)। তাই আপনার মূল দক্ষতা: token/খরচ/latency/context window বোঝা, সঠিক model বাছা, আর hallucination সামলানো — মডেলের ভেতরের গণিত নয়।

🔮 ৫. "পরের token" — LLM-এর একমাত্র কাজ

Input: "বাংলাদেশের রাজধানী" | v (LLM পুরো vocabulary-তে সম্ভাবনা দেয়) "ঢাকা" : 0.92 "হলো" : 0.04 "একটি" : 0.02 ... | v (সবচেয়ে সম্ভাব্য/sample করা token বাছে) Output token: "ঢাকা" | v (এটা input-এ যোগ করে আবার শুরু) "বাংলাদেশের রাজধানী ঢাকা" -> পরের token -> ...

এই একটা loop — "পরের token predict, যোগ করো, আবার" — বারবার চলে যতক্ষণ না উত্তর শেষ হয়। এটাকে বলে autoregressive generation

🎟️ ৬. Token আবার (word নয়!) ও খরচ

S07E01-এ শিখেছিলাম token ≠ word। এটা এখানে টাকার সাথে জড়িত: LLM API সাধারণত token অনুযায়ী টাকা নেয় (input + output উভয়)। তাই খরচ হিসাব করতে token গুনতে জানতে হবে।

মোটামুটি হিসাব: ইংরেজিতে ১ শব্দ ≈ ১.৩ token; বাংলায় প্রায়ই বেশি (কারণ বেশিরভাগ tokenizer ইংরেজি-ঘেঁষা)। মানে একই কাজ বাংলায় করলে token বেশি লাগে → খরচ ও latency বেশি। বাংলা AI product বানানোর সময় এটা বাস্তব বিবেচনা।

🪟 ৭. Context window কী ও কেন গুরুত্বপূর্ণ

Context window = LLM একবারে কত token "দেখতে" পারে (input + output মিলিয়ে)। যেমন ৪,০০০ / ৮,০০০ / ১,২৮,০০০ token। এর বাইরের কিছু model "ভুলে যায়" — কারণ attention-এর n² খরচ (S07E05) দীর্ঘ context-কে দামি করে।

Context window = 8000 token [ system prompt ][ chat history ][ আপনার document ][ প্রশ্ন ][ উত্তরের জায়গা ] <-------------------- সব মিলিয়ে ≤ 8000 token --------------------> খুব বড় document পুরো এখানে আঁটবে না -> তাই RAG দরকার (S08)!
ঠিক এই সীমার কারণেই আমরা কোম্পানির ৫ লাখ PDF সরাসরি LLM-এ দিতে পারি না — এখান থেকেই RAG-এর প্রয়োজন জন্ম নেয় (Series 08)।

⚖️ ৮. Training ≠ Inference (সবচেয়ে জরুরি পার্থক্য)

Training (model বানানো)
• বিশাল data-তে parameter শেখানো
• শত/হাজার GPU, সপ্তাহ-মাস
• লক্ষ-কোটি ডলার খরচ
• OpenAI/Meta/Google করে
• একবার (বা মাঝেমধ্যে) হয়
Inference (model ব্যবহার)
• trained model-এ prompt দিয়ে উত্তর নেওয়া
• কয়েক সেকেন্ড, তুলনায় সস্তা
• API call বা এক GPU-তে চলে
• আমরা (AI Engineer) করি
• প্রতিবার ব্যবহারে হয়
মনে রাখুন: "LLM দিয়ে app বানানো" মানে প্রায় সবসময় inference — training নয়। এই পার্থক্যটা interview-তে বারবার আসে, আর এটা AI ≠ ML, LLM app ≠ model training-এর মতোই মৌলিক।

👨‍👩‍👧 ৯. LLM পরিবার: GPT, Llama, Mistral, Claude, Gemini

Modelবানায়বিশেষত্ব
GPT (4o ইত্যাদি)OpenAIclosed, API; সবচেয়ে জনপ্রিয়, শক্তিশালী general model
ClaudeAnthropicclosed, API; দীর্ঘ context, নিরাপত্তা-কেন্দ্রিক
GeminiGoogleclosed, API; multimodal (text+image)
LlamaMetaopen-weight — নিজে host করা যায়, privacy-বান্ধব
MistralMistral AIopen-weight — ছোট, দক্ষ, সাশ্রয়ী
গুরুত্বপূর্ণ পছন্দ: closed API (GPT/Claude/Gemini) — সহজ, কিন্তু data বাইরে যায় ও খরচ per-token; বনাম open-weight (Llama/Mistral) — নিজে host করলে data ভেতরে থাকে (bKash/সরকারি data-র জন্য জরুরি), কিন্তু GPU ও ops লাগে। এই trade-off AI Engineer-এর বাস্তব সিদ্ধান্ত।

💻 ১০. Code: একটা LLM API call

কেন API? — junior হিসেবে সবচেয়ে দ্রুত ও সস্তা শুরু; নিজে GPU-তে host করা পরে (S09)। উদাহরণটি OpenAI-শৈলীর, কিন্তু ধারণা সব provider-এ একই।

# pip install openai from openai import OpenAI client = OpenAI() # API key environment variable-এ থাকবে resp = client.chat.completions.create( model="gpt-4o-mini", # ছোট, সস্তা -> শেখার জন্য ভালো messages=[ {"role": "system", "content": "You are a helpful career assistant for Bangladesh."}, {"role": "user", "content": "junior ML engineer হতে কোন ৩টা skill আগে শিখব?"}, ], temperature=0.7, ) print(resp.choices[0].message.content) print("token খরচ:", resp.usage.total_tokens) # খরচ track করা জরুরি
লক্ষ্য করুন systemuser role — এটাই prompt engineering-এর ভিত্তি, যা আমরা Series 08-এ বিস্তারিত দেখব। আর usage.total_tokens — production-এ খরচ monitor করার চাবি।

🌡️ ১১. Temperature ও sampling — কেন উত্তর বদলায়

একই প্রশ্নে LLM কখনো ভিন্ন উত্তর দেয় কেন? কারণ পরের token বাছার সময় সে সবসময় সবচেয়ে সম্ভাব্যটা নেয় না — একটু randomness যোগ করে। এটা নিয়ন্ত্রণ করে temperature:

AI Engineer perspective: factual assistant/RAG-এ temperature কম রাখুন (consistency + কম hallucination); creative writing-এ বেশি। এই একটা প্যারামিটার প্রায়ই output quality নাটকীয়ভাবে বদলে দেয়।

💼 ১২. Boss Question ও AI Engineer perspective

Boss: "আমরা কি নিজেদের একটা ChatGPT বানাব? খরচ কত?"

উত্তর: নিজে LLM train করা মানে কোটি কোটি টাকা ও শত GPU — আমাদের দরকার নেই এবং অবাস্তব। আমাদের যা দরকার তা হলো একটা ভালো LLM (API বা open-weight Llama নিজে host) নিয়ে তার উপর আমাদের নিজস্ব data ও logic বসিয়ে application বানানো — এটাই সস্তা, দ্রুত ও যথেষ্ট। খরচ মূলত token আর (নিজে host করলে) GPU। এই সিদ্ধান্তই আমাদের বাজেট ঠিক করবে।
Must Know: LLM = next-token predictor, token/context window, training vs inference, একটা API call।
Good to Know: temperature/sampling, open vs closed model, খরচ হিসাব।
Learn Later: নিজে LLM host/serve করা, quantization, fine-tuning (S08E08, S09)।

🔎 ১৩. Job Requirement Decoder: "LLM"

JD-তে: "Experience working with Large Language Models (LLMs)."
প্রশ্নউত্তর
কী বোঝায়?LLM কীভাবে কাজ করে বোঝা এবং API/model দিয়ে application বানাতে পারা।
কেন চায়?GenAI feature (chatbot, summarize, extract) এখন প্রায় সব product-এ চাওয়া হয়।
কোন সমস্যা সমাধান করে?ভাষা বোঝা/তৈরি করার কাজ — যা আগে অসম্ভব বা ব্যয়বহুল ছিল।
junior-এর কী জানা লাগে?next-token idea, token/context window, training≠inference, একটা LLM API call করা।
এখনই কী master লাগে না?LLM train করা, GPU serving optimization, ভেতরের গণিত।
GitHub-এ কীভাবে দেখাবেন?একটা ছোট LLM-powered app (summarizer/Q&A) — token খরচ সহ।
Interview-তে?"context window কী?", "training vs inference?", "open vs closed model?", "hallucination কী?"

⚠️ ১৪. সাধারণ ভুল

ভুল ১: LLM-কে সত্যের উৎস ভাবা। → সে সম্ভাব্য token predict করে; ভুল/মিথ্যা (hallucination) দিতে পারে।

ভুল ২: LLM ব্যবহার = training ভাবা। → ব্যবহার = inference; training সম্পূর্ণ আলাদা ও ব্যয়বহুল।

ভুল ৩: token = word ধরে খরচ হিসাব। → token সাধারণত subword; বাংলায় বেশি লাগে।

ভুল ৪: context window অসীম ভাবা। → সীমিত; বড় document-এ RAG লাগে।

ভুল ৫: LLM আর embedding model গুলিয়ে ফেলা। → LLM generate করে, embedding model vector দেয় (S07E03)।

🎤 ১৫. Interview Prep

প্রশ্ন ১: LLM মূলত কী করে?
উত্তর: এতক্ষণের text দেখে সবচেয়ে সম্ভাব্য পরের token predict করে; এটা autoregressive-ভাবে বারবার করে পুরো output তৈরি করে।

প্রশ্ন ২: Context window কী এবং কেন গুরুত্বপূর্ণ?
উত্তর: একবারে model কত token দেখতে পারে (input+output)। এর বাইরের তথ্য হারায়; তাই বড় document-এ RAG দরকার।

প্রশ্ন ৩: Training আর inference-এর পার্থক্য?
উত্তর: training = বিশাল খরচে parameter শেখানো (একবার); inference = trained model ব্যবহার করে উত্তর নেওয়া (প্রতিবার, সস্তা)।

প্রশ্ন ৪: Open-weight বনাম closed API model — কখন কোনটা?
উত্তর: data privacy/নিয়ন্ত্রণ লাগলে open-weight নিজে host; দ্রুত/সহজ শুরু ও কম ops চাইলে closed API।

✍️ ১৬. হাতে-কলমে ও Project Connection

১. একটা LLM API-তে temperature 0 আর 1.0-তে একই প্রশ্ন ৩ বার করে output-এর পার্থক্য দেখুন।
২. tiktoken (বা tokenizer) দিয়ে একটা বাংলা ও একটা ইংরেজি অনুচ্ছেদের token গুনে খরচ তুলনা করুন।
৩. নিজের ভাষায় লিখুন: কেন ৫ লাখ PDF সরাসরি context window-এ দেওয়া যায় না?

আমাদের flagship "Bangladesh Tech Career Assistant" এখন V6 (LLM) পর্যায়ে ঢুকল — এটি এখন একজন ব্যবহারকারীর প্রশ্ন ("আমার এই skill আছে, কোন role target করব?") বুঝে স্বাভাবিক ভাষায় পরামর্শ দিতে পারবে। কিন্তু context window-এর সীমা আমাদের সরাসরি পরের বড় লক্ষ্যে নিয়ে যাচ্ছে — আমাদের নিজস্ব JD/knowledge base যুক্ত করা, অর্থাৎ RAG

📌 ১৭. সারসংক্ষেপ ও পরবর্তী পর্ব

এই পর্বে (এবং পুরো Series 07-এ) শিখলাম:

✓ LLM = বিশাল decoder-only Transformer, মূল কাজ next-token prediction
✓ token ≠ word; খরচ ও context window token-এ মাপা হয়
✓ context window সীমিত — তাই বড় document-এ RAG লাগে
training ≠ inference — আমরা মূলত inference/application বানাই
✓ GPT/Claude/Gemini (closed API) বনাম Llama/Mistral (open-weight) — trade-off
✓ temperature output-এর randomness নিয়ন্ত্রণ করে
✓ পুরো Series 07-এর যাত্রা: tokenization → TF-IDF → embeddings → RNN/LSTM → attention → Transformer → LLM
পরবর্তী: Series 08 — Generative AI Engineering। এবার তত্ত্ব থেকে বাস্তব application — prompt engineering, embeddings-based search, vector database, আর সেই বহু-আলোচিত RAG: কীভাবে LLM-কে আপনার কোম্পানির নিজস্ব document দিয়ে "কথা বলাবেন"। এটাই আজকের বাজারের সবচেয়ে চাহিদাসম্পন্ন skill।
© 2025 Sheikh Thanbir Alam. All Rights Reserved. thanbirtamim.github.io
এই লেখা মূল লেখকের সম্পত্তি — লিখিত অনুমতি ছাড়া কপি করে অন্য কোনো ওয়েবসাইট, ব্লগ, বই বা প্ল্যাটফর্মে প্রকাশ/বিতরণ করা কঠোরভাবে নিষিদ্ধ। Content may not be copied or republished without permission.