{"slug":"api-prismnetwork-tech-inference-v1-inference-0e2e52","title":"One LLM generation on a rented GPU, priced per request","host":"api.prismnetwork.tech","method":"POST","resource":"https://api.prismnetwork.tech/inference/v1/inference","category":"other","description":"One LLM generation on a rented GPU, priced per request.","price_listed":0.003192,"price_asked":0.003192,"state":"answering","state_label":"Answering","checks_7d":1,"answered_7d":1,"latency_ms_median":887,"reported_calls_30d":9,"reported_payers_30d":1,"networks":["eip155:4663","eip155:8453"],"badge":"unverified","paid_checks_7d":0,"paid_ok_7d":0,"example_input":{"body":{"model":"llama3.2:3b","options":{"num_predict":64},"prompt":"Explain metered GPU compute in one sentence."},"bodyType":"json","method":"POST","type":"http"},"output_schema":{"$schema":"https://json-schema.org/draft/2020-12/schema","properties":{"input":{"additionalProperties":false,"properties":{"body":{"properties":{"model":{"description":"Which model answers.","enum":["llama3.2:3b","llama3.1:8b"],"type":"string"},"options":{"description":"Generation options. The price scales with the output cap.","properties":{"num_predict":{"description":"Maximum output tokens. Lower is cheaper.","maximum":1024,"minimum":1,"type":"integer"}},"type":"object"},"prompt":{"description":"The prompt, up to 32 KiB.","minLength":1,"type":"string"}},"required":["model","prompt"],"type":"object"},"bodyType":{"enum":["json","form-data","text"],"type":"string"},"method":{"enum":["POST","PUT","PATCH"],"type":"string"},"type":{"const":"http","type":"string"}},"required":["type","method","bodyType","body"],"type":"object"},"output":{"properties":{"example":{"properties":{"lease_id":{"description":"The GPU lease that served it.","type":["integer","null"]},"model":{"type":"string"},"response":{"description":"The generated text.","type":"string"},"usage":{"properties":{"completion_tokens":{"type":["integer","null"]},"duration_ms":{"type":["integer","null"]},"prompt_tokens":{"type":["integer","null"]}},"type":"object"}},"required":["model","response"],"type":"object"},"type":{"type":"string"}},"required":["type"],"type":"object"}},"required":["input"],"type":"object"},"history":[{"day":"2026-09-24","reachable":true,"status":402,"valid_402":true,"asked_usdc":0.003192,"price_match":true,"latency_ms":887,"error":null}],"description_full":"One LLM generation on a rented GPU, priced per request.","last_updated":"2026-09-11T12:58:09.829Z","schemes":["exact"]}