大模型·词嵌入
·
词嵌入是指将token映射为蕴含语义的词向量的技术。每个token都可以被映射成一个向量,在映射的过程中,词嵌入的过程可以捕捉和记录单词的语义信息,使得语义上相近的单词在向量空间中的距离也相近。这种方法能够帮助模型更好的理解和处理自然语言数据。
from gensim.models import Word2Vec
import jieba # 中文分词示例,英文可直接 split
# 示例中文语料(实际可替换为更大的文本文件)
sentences = [
"人工智能正在改变世界",
"机器学习是人工智能的一个分支",
"深度学习利用神经网络进行学习",
"自然语言处理让机器理解人类语言",
"词向量是自然语言处理的基础技术"
]
# 分词处理
tokenized_sents = [list(jieba.cut(sent)) for sent in sentences]
print(tokenized_sents)
[['人工智能', '正在', '改变', '世界'], ['机器', '学习', '是', '人工智能', '的', '一个', '分支'], ['深度', '学习', '利用', '神经网络', '进行', '学习'], ['自然语言', '处理', '让', '机器', '理解', '人类', '语言'], ['词', '向量', '是', '自然语言', '处理', '的', '基础', '技术']]
更多推荐





所有评论(0)