最新的回應
| 發表人 | 討論 | 發表時間 |
|---|---|---|
M11433002 | 1.文字切塊(Chunking)與標記化(Tokenization)。 2.轉為語意向量(Embedding)並存入向量資料庫(Vector DB)。 3.提問時進行相似度檢索,並將相關段落餵給 LLM 生成回答。 | 5 天前 |
M11433010 | 實務上,一般文字的量化處理通常是先將文字進行清理與整理,再依研究目的轉換成可以分析的數值,例如計算詞頻、使用 TF-IDF 或將文字轉成向量(embedding),也可以進一步將文字分類成情緒、主題或其他類別,最後透過統計方法分析不同文字內容之間的差異、關聯或趨勢。 | 5 天前 |
d11333006 | 文字量化就是先把文字切成字或詞,再用出現次數、TF-IDF,或現在常見的 Embedding 字詞向量,把文字轉成電腦可以計算的數字。這樣 AI 才能去比較不同文字之間的關係,進一步理解或分析文字。 | 5 天前 |
M11433005 | 例如 Token(詞元),再將 Token 轉換成數字或向量。接著依需求使用 8-bit、4-bit 等較低精度來表示這些數值,以減少模型的記憶體使用量與運算成本,同時盡量維持模型的準確度。 簡單來說就是: 文字 → Token → 數值/向量 → 降低數值精度(如 INT8、INT4) → 模型運算。 | 5 天前 |