大模型介绍

LLM:Large Language Model,大语言模型。是一种基于机器学习和自然语言处理技术的模型,它通过对大量的文本数据进行训练,来学习服务人类语言理解和生成的能力

常见大模型:

常见大模型
国家 对话产品 大模型 链接
国外 OpenAI ChatGPT GPT-4 Turbo、GPT-4o https://chat.openai.com/
Microsoft Copilot GPT-4、Phi-3(部分功能) https://copilot.microsoft.com/
Google Gemini Gemini Ultra、Gemini Pro https://gemini.google.com/
Anthropic Claude Claude 3(Opus/Sonnet/Haiku) https://claude.ai/
Inflection Pi Inflection-2 https://pi.ai/
xAI Grok Grok-1.5 https://grok.x.ai/
中国 文心一言 文心大模型4.0 https://yiyan.baidu.com/
讯飞星火 星火大模型V3.5 https://xinghuo.xfyun.cn/
智谱清言 ChatGLM-4 https://chatglm.cn/
月之暗面 Kimi Chat Moonshot V2(长文本支持400万token)  https://kimi.moonshot.cn/
MiniMax星野 abab6.5 https://www.xingyai.com/
零一万物 万知 Yi-Large  https://www.01.ai/cn
抖音豆包 云雀大模型 https://www.doubao.com/
通义千问 通义千问2.0、3.0 https://tongyi.aliyun.com/

 DeepSeek 案例

deepseek官网API文档:https://api-docs.deepseek.com/zh-cn/api/create-chat-completion

Maven依赖

<dependency>
    <groupId>com.squareup.okhttp3</groupId>
    <artifactId>okhttp</artifactId>
    <version>3.14.9</version>
</dependency>
public static void main(String[] args) {
        try {
            OkHttpClient client = new OkHttpClient().newBuilder()
                    .readTimeout(20, TimeUnit.SECONDS)
                    .connectTimeout(20, TimeUnit.SECONDS)
                    .build();
            MediaType mediaType = MediaType.parse("application/json");
            RequestBody body = RequestBody.create(mediaType, "{\n  \"messages\": [\n    {\n      \"content\": \"You are a helpful assistant\",\n      \"role\": \"system\"\n    },\n    {\n      \"content\": \"Hi\",\n      \"role\": \"user\"\n    }\n  ],\n  \"model\": \"deepseek-chat\",\n  \"thinking\": {\n    \"type\": \"disabled\"\n  },\n  \"frequency_penalty\": 0,\n  \"max_tokens\": 4096,\n  \"presence_penalty\": 0,\n  \"response_format\": {\n    \"type\": \"text\"\n  },\n  \"stop\": null,\n  \"stream\": false,\n  \"stream_options\": null,\n  \"temperature\": 1,\n  \"top_p\": 1,\n  \"tools\": null,\n  \"tool_choice\": \"none\",\n  \"logprobs\": false,\n  \"top_logprobs\": null\n}");
            Request request = new Request.Builder()
                    .url("https://api.deepseek.com/chat/completions")
                    .method("POST", body)
                    .addHeader("Content-Type", "application/json")
                    .addHeader("Accept", "application/json")
                    // Authorization 为DeepSeek申请的API Key
                    .addHeader("Authorization", "Bearer youself-api-key")
                    .build();
            Response response = client.newCall(request).execute();
        } catch (IOException e) {
            throw new RuntimeException(e);
        }
    }

TOKEN说明

Token是在⼤语⾔模型中中模型进⾏语⾔处理的基本信息单元,可以是⼀个字或⼀个词、⼀个短语句⼦。Token并不是⼀成不变的,在不同的上下⽂(在最新的⼀个提问之前所有的聊天记录)中,他会有不同的划分粒度。可以在https://platform.openai.com/tokenizer中测试Token的数量。

每个模型都有⼀个MAX TOKENS的参数,指在⼀次会话中,模型能基于整个上下⽂记忆的最⼤的Token数量,这个上下⽂既包含了我们的输⼊,也包含了我们的输出。

⼀次会话指的是你打开了⼀个和ChatGPT的聊天窗⼝,只要你没有关闭和ChatGPT聊天的这个窗口,那么这个窗⼝就是你和ChatGPT的⼀次会话,⽆论你们已经聊了多久

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐