Show HN:Qwen3.8-27B API,單 GPU 上每秒 140 個 token
一位開發者在 Hacker News 上展示了 Qwen3.8-27B 的 API 服務,聲稱在單張 GPU 上可實現每秒 140 個 token 的推理速度。
近日,一位開發者在 Hacker News 的 Show HN 板塊發佈了一款基於 Qwen3.8-27B 模型的 API 服務,並展示了其性能表現。根據發佈信息,該服務在單張 GPU 上即可達到每秒 140 個 token 的推理速度。目前該 API 的訪問入口位於 tiyuvta.ai 平台,但具體的技術實現細節和定價尚未在帖子中説明。