Show HN:Qwen3.8-27B API,單 GPU 上每秒 140 個 token
一位開發者在 Hacker News 上展示了 Qwen3.8-27B 的 API 服務,聲稱在單張 GPU 上可實現每秒 140 個 token 的推理速度。
近日,一位開發者在 Hacker News 的 Show HN 板塊釋出了一款基於 Qwen3.8-27B 模型的 API 服務,並展示了其效能表現。根據釋出資訊,該服務在單張 GPU 上即可達到每秒 140 個 token 的推理速度。目前該 API 的訪問入口位於 tiyuvta.ai 平臺,但具體的技術實現細節和定價尚未在帖子中說明。