安文
實務上,一般的文字的量化處理的是大約怎麼做?
6 天前 1 樓
顯示先前的回應4 則當中的 3 則
d11333006
文字量化就是先把文字切成字或詞,再用出現次數、TF-IDF,或現在常見的 Embedding 字詞向量,把文字轉成電腦可以計算的數字。這樣 AI 才能去比較不同文字之間的關係,進一步理解或分析文字。
5 天前 3 樓
M11433010
實務上,一般文字的量化處理通常是先將文字進行清理與整理,再依研究目的轉換成可以分析的數值,例如計算詞頻、使用 TF-IDF 或將文字轉成向量(embedding),也可以進一步將文字分類成情緒、主題或其他類別,最後透過統計方法分析不同文字內容之間的差異、關聯或趨勢。
5 天前 4 樓
M11433002
1.文字切塊(Chunking)與標記化(Tokenization)。
2.轉為語意向量(Embedding)並存入向量資料庫(Vector DB)。
3.提問時進行相似度檢索,並將相關段落餵給 LLM 生成回答。
5 天前 5 樓