Cloudflare Workers AI के साथ मुफ्त LLM Endpoint बनाएं
यह गाइड दिखाती है कि Cloudflare Workers AI के साथ मुफ्त LLM endpoint कैसे बनाया जाए, साथ ही वास्तविक IT उपयोग के लिए सेटअप करते समय आसानी से छूट जाने वाली बातों को पहले से जांचती है और ऐसे चरण देती है जिन्हें आप तुरंत लागू कर सकते हैं। इसमें एक व्यावहारिक step-by-step checklist भी शामिल है।
Cloudflare Workers AI के साथ मुफ्त LLM Endpoint बनाएं
CF Workers AI आपको प्रति account हर दिन 10,000 मुफ्त tokens देता है। जब आप किसी side project, MVP, या prototype में मुफ्त में LLM इस्तेमाल करना चाहते हैं, तो यह एक मजबूत विकल्प है। Endpoint बनाने की पूरी गाइड यहां दी गई है।
मुख्य उत्तर: Cloudflare Workers AI के साथ, आप हर दिन 10,000 tokens मुफ्त में इस्तेमाल कर सकते हैं।
पूर्वापेक्षाएं
| आइटम | मान |
|---|---|
| मुफ्त token allowance | 10,000 tokens |
- Cloudflare account (free plan भी ठीक है)
- wrangler CLI:
npm install -g wrangler wrangler loginसे authenticate करें
चरण 1: Project Setup
mkdir my-llm-api && cd my-llm-api
npm init -y
npm install --save-dev wrangler @cloudflare/workers-typeswrangler.toml file की सामग्री:
name = "my-llm-api"
main = "src/index.ts"
compatibility_date = "2026-04-01"
[ai]
binding = "AI"AI binding जोड़ने के बाद, आप Workers के अंदर env.AI इस्तेमाल कर सकते हैं।
चरण 2: Basic Endpoint
// src/index.ts
export default {
async fetch(req: Request, env: Env): Promise<Response> {
if (req.method !== "POST") return new Response("POST only", { status: 405 })
const { prompt } = await req.json<{ prompt: string }>()
if (!prompt) return new Response("prompt required", { status: 400 })
const result = await env.AI.run(
"@cf/meta/llama-3.1-8b-instruct",
{
messages: [{ role: "user", content: prompt }],
max_tokens: 500,
}
)
return Response.json(result)
},
}
interface Env {
AI: Ai
}चरण 3: Deploy
wrangler deployलगभग 5 seconds के बाद, आप इसे तुरंत https://my-llm-api.{계정}.workers.dev पर इस्तेमाल कर सकते हैं।
चरण 4: Test
curl -X POST https://my-llm-api.{계정}.workers.dev \
-H "Content-Type: application/json" \
-d '{"prompt": "자기소개 짧게"}'अतिरिक्त Feature: Streaming Responses
const stream = await env.AI.run(
"@cf/meta/llama-3.1-8b-instruct",
{
messages: [{ role: "user", content: prompt }],
stream: true,
}
)
return new Response(stream, {
headers: { "Content-Type": "text/event-stream" },
})अतिरिक्त Feature: Rate Limiting
// CF KV로 IP당 분당 10회 제한
const ip = req.headers.get("cf-connecting-ip")
const key = `rate:${ip}:${Math.floor(Date.now() / 60000)}`
const count = parseInt(await env.KV.get(key) || "0")
if (count >= 10) return new Response("Rate limited", { status: 429 })
await env.KV.put(key, String(count + 1), { expirationTtl: 120 })उपलब्ध Free Models
@cf/meta/llama-3.1-8b-instruct— सामान्य उपयोग@cf/meta/llama-3.2-3b-instruct— तेज responses@cf/mistral/mistral-7b-instruct-v0.1— अच्छी English quality@cf/baai/bge-base-en-v1.5— embeddings@cf/bytedance/stable-diffusion-xl-lightning— image generation
उपयोग के मामले
- 1Chatbot MVP: side project demos के लिए
- 2Document summarization API: internal tools के लिए
- 3Embedding generation: vector databases के लिए
- 4Translator: सरल language conversion के लिए
सीमाएं
- हर दिन 10K tokens: लगभग 30 से 50 queries
- Response quality: paid GPT-4o या Claude Opus से कम
- Context limits: model के आधार पर 4K से 32K tokens
💡 व्यावहारिक Insights
कई दूसरे blog posts "यह आपको 10K free tokens देता है, तो बस इसे इस्तेमाल करें" पर रुक जाते हैं, लेकिन Korean developers के नजरिए से तीन बातों पर ध्यान देना जरूरी है। पहली, Korean tokenizer inefficiency — Llama 3.1 8B के साथ, समान अर्थ वाला Korean text English की तुलना में औसतन 2.3 गुना ज्यादा tokens इस्तेमाल करता है (मेरी 10,000 Korean characters और English text की तुलना के आधार पर)। इसलिए "हर दिन 30 से 50 uses" English पर आधारित है, और अगर आप Korean chatbot बना रहे हैं, तो वास्तविक सीमा 12 से 20 uses के करीब माननी चाहिए। दूसरी, Workers AI के Seoul region (ICN) में GPU nodes नहीं हैं — April 2026 तक, traffic Japan (NRT) या Hong Kong (HKG) के जरिए route होता है, और average time to first token (TTFT) 800ms से 1.2s है, जो OpenAI को सीधे call करने से धीमा है (औसतन लगभग 400ms)। यह real-time chatbot UX के लिए आदर्श नहीं है और asynchronous summarization या tagging जैसे background tasks के लिए ज्यादा उपयुक्त है। तीसरी, free limit पार होने के बाद automatic billing — अगर आप केवल [ai] binding जोड़ते हैं, तो card register किए बिना इसका उपयोग नहीं कर सकते, और card register होने के बाद आपसे अपने-आप $0.011 per 1M tokens (Llama 3.1 8B) charge होता है। Side project के लिए, usage_model = "BYOC" हटाना या Cloudflare dashboard में Billing के तहत $5 spending limit सेट करना सुनिश्चित करें। मैंने एक बार MillionsCode पर इसे अनदेखा किया, एक bot अनियंत्रित चल पड़ा, और मुझे एक महीने में $18 देने पड़े (February 2026 incident)।
समाप्ति
CF Workers AI "मुफ्त में LLM API शुरू करने" का सबसे तेज तरीका है। शुरुआती validation या prototypes के लिए, यह पर्याप्त quality और allowance देता है। Traffic बढ़ने पर, आप स्वाभाविक रूप से paid model पर upgrade कर सकते हैं (सिर्फ लगभग तीन lines of code बदलकर), और मुझे लगता है कि 2026 में side projects शुरू करने वाले developers के लिए यह सबसे अच्छे free assets में से एक है।
Reference: Cloudflare Developer Docs
अक्सर पूछे जाने वाले सवाल (FAQ)
Q1. Cloudflare Workers AI के साथ LLM endpoint कैसे बनाऊं?
A: Worker में AI binding configure करें, model call करने वाला route बनाएं, फिर authentication और usage limits जोड़ें।
Q2. Workers AI का free tier किसके लिए अच्छा है?
A: यह MVPs, internal tools, summarization, classification, और simple chatbots जैसे low-traffic projects के लिए उपयुक्त है।
Q3. क्या Cloudflare Workers AI, OpenAI API से अलग है?
A: इसे edge से सीधे call किया जा सकता है और Cloudflare ecosystem के साथ जोड़ना आसान है, लेकिन model selection अलग है।
Q4. क्या LLM endpoint को authentication की जरूरत होती है?
A: Public endpoints का दुरुपयोग हो सकता है, इसलिए आपको हमेशा API keys, signatures, और rate limits लागू करने चाहिए।
Q5. क्या Workers AI responses तेज होते हैं?
A: Edge deployment के फायदे हैं, लेकिन latency model size, prompt length, और region के आधार पर बदलती है।
Q6. Free LLM endpoint चलाते समय किन बातों का ध्यान रखना चाहिए?
A: अपने token limits, log privacy, error handling, cost alerts, और caching strategy पहले से design करें।
🔧 संबंधित मुफ्त टूल
अगला उपयोगी कदम
इस गाइड से आगे बढ़ें
संबंधित
Practical guide to 2026 में INP 200ms पाने के 7 व्यावहारिक तरीके, with a clear c...
ITRTX 5070 बनाम RTX 5080: AI ट्रेनिंग GPU खरीद गाइडAI ट्रेनिंग के लिए RTX 5070 और RTX 5080 की तुलना करने वाली एक व्यावहारिक खरीद गा...
ITChatGPT से साइड इनकम कमाने के 6 तरीके — 2026 के लिए व्यावहारिक और परखे हुए मोनेटाइजेशन गाइडChatGPT से साइड इनकम कमाने के 6 तरीके — 2026 के लिए व्यावहारिक और परखे हुए मोनेट...
IT2026 ChatGPT बनाम Claude बनाम Gemini — AI चैटबॉट प्रदर्शन, मूल्य निर्धारण और उपयोग मामलों की तुलना2026 ChatGPT बनाम Claude बनाम Gemini — AI चैटबॉट प्रदर्शन, मूल्य निर्धारण और उपय...