健行科技大學eclass易課平台
×
登入
回學校
健行科技大學 首頁
招生資訊
電資學院
工程學院
商管學院
民生創意學院
通識教育中心
手機版
系統教學
功能特色
線上教學
翻轉教學應用分享
開放課程
位置:
AI人工智慧
>
教材
>
Natural language Processing、字詞向量與 TTS之一(930)
> 回應列表
安文
實務上,一般的文字的量化處理的是大約怎麼做?
6 天前
1 樓
顯示先前的回應
4 則當中的 3 則
M11433005
例如 Token(詞元),再將 Token 轉換成數字或向量。接著依需求使用 8-bit、4-bit 等較低精度來表示這些數值,以減少模型的記憶體使用量與運算成本,同時盡量維持模型的準確度。
簡單來說就是:
文字 → Token → 數值/向量 → 降低數值精度(如 INT8、INT4) → 模型運算。
5 天前
2 樓
d11333006
文字量化就是先把文字切成字或詞,再用出現次數、TF-IDF,或現在常見的 Embedding 字詞向量,把文字轉成電腦可以計算的數字。這樣 AI 才能去比較不同文字之間的關係,進一步理解或分析文字。
5 天前
3 樓
M11433010
實務上,一般文字的量化處理通常是先將文字進行清理與整理,再依研究目的轉換成可以分析的數值,例如計算詞頻、使用 TF-IDF 或將文字轉成向量(embedding),也可以進一步將文字分類成情緒、主題或其他類別,最後透過統計方法分析不同文字內容之間的差異、關聯或趨勢。
5 天前
4 樓
M11433002
1.文字切塊(Chunking)與標記化(Tokenization)。
2.轉為語意向量(Embedding)並存入向量資料庫(Vector DB)。
3.提問時進行相似度檢索,並將相關段落餵給 LLM 生成回答。
5 天前
5 樓