Show HN:Qwen3.8-27B API,单 GPU 上每秒 140 个 token
一位开发者在 Hacker News 上展示了 Qwen3.8-27B 的 API 服务,声称在单张 GPU 上可实现每秒 140 个 token 的推理速度。
近日,一位开发者在 Hacker News 的 Show HN 板块发布了一款基于 Qwen3.8-27B 模型的 API 服务,并展示了其性能表现。根据发布信息,该服务在单张 GPU 上即可达到每秒 140 个 token 的推理速度。目前该 API 的访问入口位于 tiyuvta.ai 平台,但具体的技术实现细节和定价尚未在帖子中说明。