Windows CPU部署llama2量化模型并实现API接口

模型部署

从huggingface下载模型
https://huggingface.co/
放在本地文件夹，如下
在这里插入图片描述

本地运行llama2

from ctransformers import AutoModelForCausalLMllm = AutoModelForCausalLM.from_pretrained("D:\llm\llama2\models\llama2-7b-chat-ggml", model_file = 'llama-2-7b-chat.ggmlv3.q3_K_S.bin')print(llm('<s>Human: 介绍一下中国\n</s><s>Assistant: '))

使用fastapi实现API接口

服务端

import uvicorn
from fastapi import FastAPI
from pydantic import BaseModel
from ctransformers import AutoModelForCausalLM
# 参考 https://blog.csdn.net/qq_36187610/article/details/131835752app = FastAPI()class Query(BaseModel):text: str@app.post("/chat/")
async def chat(query: Query):input = query.text llm = AutoModelForCausalLM.from_pretrained("D:\llm\llama2\models\llama2-7b-chat-ggml", model_file = 'llama-2-7b-chat.ggmlv3.q3_K_S.bin')output = llm('<s>Human: ' + input + '\n</s><s>Assistant: ')print(output)   return {"result": output}if __name__ == "__main__":uvicorn.run(app, host="0.0.0.0", port=6667)

客户端

import requestsurl = "http://192.168.3.16:6667/chat/"  # 注意这里ip地址不能使用0.0.0.0,而是使用实际IP地址，通过ipconfig可以查看
query = {"text": "你好，请做一段自我介绍，使用中文回答，不能超过100个字。"}response = requests.post(url, json=query)if response.status_code == 200:result = response.json()print("BOT:", result["result"])
else:print("Error:", response.status_code, response.text)

常用git仓库

https://github.com/marella/ctransformers
https://github.com/FlagAlpha/Llama2-Chinese
https://github.com/tiangolo/fastapi

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.mzph.cn/news/591648.shtml

如若内容造成侵权/违法违规/事实不符，请联系多彩编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

Windows CPU部署llama2量化模型并实现API接口

目录

模型部署

本地运行llama2

使用fastapi实现API接口

常用git仓库

相关文章

请求转发和重定向的区别

微软好听的tts语音包下载，粤语，韩语，日语

gitee添加仓库人员

Superset二次开发之环境部署（Docker版）

1214：八皇后深度优先搜索算法

深度生成模型之GAN的评估 -＞（个人学习记录笔记）

2024年腾讯云服务器租用价格表_优惠活动大全_实时更新

NA原理及配置

PyTorch官网demo解读——第一个神经网络（4）

十年磨一剑，花为缘享奢app打造行业的又一颠覆性创新

旅游平台网页前后端

Debezium日常分享系列之：Debezium 通知

Wnmp本地部署结合内网穿透实现任意浏览器远程访问本地服务

测开基础概念

chromium通信系统-ipcz系统(九)-ipcz系统代码实现-跨Node通信-代理和代理消除

如何使用甘特图进行项目管理？

第二十三章反射(reflection)

虚幻UE 材质-边界混合之PDO像素深度偏移量

Nginx(十四) 配置文件详解 - 负载均衡（超详细）

HAL——点灯