大模型学习(一、入门)
·
大模型介绍
LLM:Large Language Model,大语言模型。是一种基于机器学习和自然语言处理技术的模型,它通过对大量的文本数据进行训练,来学习服务人类语言理解和生成的能力
常见大模型:
- ChatGPT: https://chatgpt.com/ (https://openai.com/)
- Deepseek: https://platform.deepseek.com/
| 国家 | 对话产品 | 大模型 | 链接 |
|---|---|---|---|
| 国外 | OpenAI ChatGPT | GPT-4 Turbo、GPT-4o | https://chat.openai.com/ |
| Microsoft Copilot | GPT-4、Phi-3(部分功能) | https://copilot.microsoft.com/ | |
| Google Gemini | Gemini Ultra、Gemini Pro | https://gemini.google.com/ | |
| Anthropic Claude | Claude 3(Opus/Sonnet/Haiku) | https://claude.ai/ | |
| Inflection Pi | Inflection-2 | https://pi.ai/ | |
| xAI Grok | Grok-1.5 | https://grok.x.ai/ | |
| 中国 | 文心一言 | 文心大模型4.0 | https://yiyan.baidu.com/ |
| 讯飞星火 | 星火大模型V3.5 | https://xinghuo.xfyun.cn/ | |
| 智谱清言 | ChatGLM-4 | https://chatglm.cn/ | |
| 月之暗面 Kimi Chat | Moonshot V2(长文本支持400万token) | https://kimi.moonshot.cn/ | |
| MiniMax星野 | abab6.5 | https://www.xingyai.com/ | |
| 零一万物 万知 | Yi-Large | https://www.01.ai/cn | |
| 抖音豆包 | 云雀大模型 | https://www.doubao.com/ | |
| 通义千问 | 通义千问2.0、3.0 | https://tongyi.aliyun.com/ |
DeepSeek 案例
deepseek官网API文档:https://api-docs.deepseek.com/zh-cn/api/create-chat-completion
Maven依赖
<dependency>
<groupId>com.squareup.okhttp3</groupId>
<artifactId>okhttp</artifactId>
<version>3.14.9</version>
</dependency>
public static void main(String[] args) {
try {
OkHttpClient client = new OkHttpClient().newBuilder()
.readTimeout(20, TimeUnit.SECONDS)
.connectTimeout(20, TimeUnit.SECONDS)
.build();
MediaType mediaType = MediaType.parse("application/json");
RequestBody body = RequestBody.create(mediaType, "{\n \"messages\": [\n {\n \"content\": \"You are a helpful assistant\",\n \"role\": \"system\"\n },\n {\n \"content\": \"Hi\",\n \"role\": \"user\"\n }\n ],\n \"model\": \"deepseek-chat\",\n \"thinking\": {\n \"type\": \"disabled\"\n },\n \"frequency_penalty\": 0,\n \"max_tokens\": 4096,\n \"presence_penalty\": 0,\n \"response_format\": {\n \"type\": \"text\"\n },\n \"stop\": null,\n \"stream\": false,\n \"stream_options\": null,\n \"temperature\": 1,\n \"top_p\": 1,\n \"tools\": null,\n \"tool_choice\": \"none\",\n \"logprobs\": false,\n \"top_logprobs\": null\n}");
Request request = new Request.Builder()
.url("https://api.deepseek.com/chat/completions")
.method("POST", body)
.addHeader("Content-Type", "application/json")
.addHeader("Accept", "application/json")
// Authorization 为DeepSeek申请的API Key
.addHeader("Authorization", "Bearer youself-api-key")
.build();
Response response = client.newCall(request).execute();
} catch (IOException e) {
throw new RuntimeException(e);
}
}
TOKEN说明
Token是在⼤语⾔模型中中模型进⾏语⾔处理的基本信息单元,可以是⼀个字或⼀个词、⼀个短语句⼦。Token并不是⼀成不变的,在不同的上下⽂(在最新的⼀个提问之前所有的聊天记录)中,他会有不同的划分粒度。可以在https://platform.openai.com/tokenizer中测试Token的数量。
每个模型都有⼀个MAX TOKENS的参数,指在⼀次会话中,模型能基于整个上下⽂记忆的最⼤的Token数量,这个上下⽂既包含了我们的输⼊,也包含了我们的输出。
⼀次会话指的是你打开了⼀个和ChatGPT的聊天窗⼝,只要你没有关闭和ChatGPT聊天的这个窗口,那么这个窗⼝就是你和ChatGPT的⼀次会话,⽆论你们已经聊了多久
更多推荐




所有评论(0)