Show HN:TamedTable——用自然語言操作 AI ETL
TamedTable 是一款用自然語言完成資料清洗、轉換、分類和驗證的 AI ETL 工具,無需公式或程式碼,支援 CSV、JSONL、Parquet 和 Arrow 等格式。它提供可復現的步驟、撤銷操作、Python 指令碼匯出,並可在瀏覽器和命令列中使用。其基準測試中,預設模型在每千行分類成本約 0.15 美元的情況下,匹配人工標註的準確率達 96.7%。
TamedTable 是一個面向表格資料的 AI ETL 工具,核心理念是“用自然語言和你的資料對話”。使用者無需編寫公式或程式碼,只需載入表格資料,然後用日常語言描述想要的操作,AI 就會執行。產品以 Web 應用形式提供,也支援命令列,並且原始碼可獲取(source-available),使用者可以使用自己的 API 金鑰執行。
在功能層面,TamedTable 能夠理解上下文,因此可以完成公式難以做到的清理、豐富、分類和校驗等任務。比如,AI 會逐行讀取上下文後再決定如何處理混亂的欄位,也可以從自由文本中抽取結構,或者識別每一行的語義並進行分類。平臺提供了多種演示場景,包括清理、豐富與抽取、分類、驗證、語言處理,以及確定性的精確操作。
TamedTable 的設計強調可見性和可控性。使用者能看到每一步的即時變化,不喜歡可以隨時撤銷。所有操作都會成為歷史記錄,也可以儲存為可重放的“配方”(recipe),用於處理新資料,或者匯出為純 Python 指令碼,在離開該工具後繼續執行。資料始終保留在開放格式中,不存在供應商鎖定。
工具支援從本地或 URL 讀取 CSV、JSONL、Parquet 和 Arrow 檔案,並且指令支援多種語言,包括英語和中文。它還提供了“懶執行”模式:AI 步驟只對當前預覽頁執行,成本很低,等使用者確認後再執行完整資料集。官方還提供了一個無需 API 金鑰的引導式導覽,重放真實會話,方便使用者快速體驗。
在可靠性方面,TamedTable 的 CI 會在每次提交時重放 606 個測試場景。官方基準測試顯示,預設模型在分類任務中匹配人工標註標籤的準確率為 96.7%,每 1000 行的分類成本約為 0.15 美元。每個請求都會生成一個可讀的小規格說明,確定性步驟由真實 SQL 引擎執行,同一配方可以複用到下個月的新檔案上。
使用者可以在瀏覽器中直接開啟 Web 應用,或在 GitHub 上檢視專案。該工具適合希望用更低門檻處理表格資料的個人和團隊,尤其是那些希望保留資料自主權、又需要 AI 輔助完成資料管道任務的使用者。