# TPS Calculator (한국어) > GPU, 모델, 양자화, 추론 프레임워크로 LLM의 추론 속도(token/s), VRAM, 지연을 추정합니다. 사이트: https://tps.bunai.com/ 소스: https://github.com/adiudiuu/tps 다른 언어: [简体中文](/llms.zh.txt) / [繁體中文](/llms.zh-TW.txt) / [English](/llms.txt) / [Русский](/llms.ru.txt) / [Español](/llms.es.txt) / [日本語](/llms.ja.txt) UI: 간체 중국어 기본(쿼리 없음); `?lang=zh-TW` / `?lang=en` / `?lang=ru` / `?lang=es` / `?lang=ko` / `?lang=ja` 카탈로그(라이브러리 실시간 집계): **모델 400개**, **GPU 251개**. 데이터 갱신 **2026-08-20** (`UPDATED_AT_BEIJING`). ## 카탈로그의 인기 모델 | 모델 | 선정 이유 | |------|-----------| | **Qwen3.8-Max** | 오픈웨이트 2.4T-A95B (HF / ModelScope, 2026-08-12) | | **Qwen3.8-27B** | 오픈웨이트 밀집 VLM (HF / ModelScope, 2026-08-14) | | **Kimi K3** | 대형 MoE, 2026-07 | | **Hy3** | Tencent MoE 295B-A21B (HF / ModelScope, 2026-07) | | **GLM-5.2** | GLM-5 최신 라인 (2026-06) | | **DeepSeek V4** (Pro / Flash) | 현재 DeepSeek 세대 (2026-04) | | **MiniMax M3** | 2026-06 출시 | | **Gemma 4** | Google Gemma 4 계열 (2026-06) | | **Llama 4** (Maverick / Scout) | Meta Llama 4 MoE | | **Nemotron 3** (Ultra / Super / Nano) | NVIDIA Nemotron 3 라인 | 라이브러리에는 이전 Qwen3 / DeepSeek V3 / Llama 3.x 항목도 남아 있습니다. ## 카탈로그의 인기 GPU | GPU | 구분 | |-----|------| | **RTX 5090 / 5080 / 4090** | 컨슈머 | | **B200 SXM / H200 SXM / H100 SXM** | NVIDIA 데이터센터 | | **MI300X** | AMD 데이터센터 | 대표 질문: 8×H200에서 DeepSeek V4? B200에서 GLM-5.2 VRAM? RTX 5090에서 Gemma 4 TPS? MI300X에서 Kimi K3 / Hy3? ## 계산 항목 - Decode / Prefill TPS - VRAM: 가중치, KV 캐시, 오버헤드; OOM 표시 - 지연: TTFT, TPOT, end-to-end - Roofline: 대역폭 vs 연산 - 멀티 GPU Tensor Parallel 공개 GPU 스펙의 Roofline × 프레임워크 효율. 이론 상한이며 실측 벤치가 아닙니다. ## 페이지 - [추정](https://tps.bunai.com/?lang=ko) - [속도 순위](https://tps.bunai.com/ranking?lang=ko) - [라이브러리](https://tps.bunai.com/library?lang=ko) - [구성 추천](https://tps.bunai.com/solver?lang=ko) - [설명](https://tps.bunai.com/about?lang=ko) ## 프레임워크 / 양자화 vLLM, TensorRT-LLM, llama.cpp, MLX, SGLang, TGI · FP32–INT2 / GGUF K-quants ## 스택 Vue 3 + Vite + Tailwind. 클라이언트 전용.