健行科技大學eclass易課平台
×
登入
  • 回學校
    • 健行科技大學 首頁
    • 招生資訊
    • 電資學院
    • 工程學院
    • 商管學院
    • 民生創意學院
    • 通識教育中心
  • 手機版
  • 系統教學
    • 功能特色
    • 線上教學
    • 翻轉教學應用分享
  • 開放課程
位置: AI人工智慧 > 教材 > Natural language Processing、字詞向量與 TTS之一(930) > 最新的回應
最新的回應
發表人討論發表時間
M11433002
1.文字切塊(Chunking)與標記化(Tokenization)。 2.轉為語意向量(Embedding)並存入向量資料庫(Vector DB)。 3.提問時進行相似度檢索,並將相關段落餵給 LLM 生成回答。5 天前
M11433010
實務上,一般文字的量化處理通常是先將文字進行清理與整理,再依研究目的轉換成可以分析的數值,例如計算詞頻、使用 TF-IDF 或將文字轉成向量(embedding),也可以進一步將文字分類成情緒、主題或其他類別,最後透過統計方法分析不同文字內容之間的差異、關聯或趨勢。5 天前
d11333006
文字量化就是先把文字切成字或詞,再用出現次數、TF-IDF,或現在常見的 Embedding 字詞向量,把文字轉成電腦可以計算的數字。這樣 AI 才能去比較不同文字之間的關係,進一步理解或分析文字。5 天前
M11433005
例如 Token(詞元),再將 Token 轉換成數字或向量。接著依需求使用 8-bit、4-bit 等較低精度來表示這些數值,以減少模型的記憶體使用量與運算成本,同時盡量維持模型的準確度。 簡單來說就是: 文字 → Token → 數值/向量 → 降低數值精度(如 INT8、INT4) → 模型運算。5 天前

©Copyright  健行科技大學 Chien Hsin University of Science and Technology All rights reserved.
本網站僅作學術研究用途,不得從事商業用途,請尊重智慧財產權,避免任何侵權行為,勿上傳/下載未經授權之檔案資料。
Please respect the intellectual property rights.