快速体验 Llama3 的 4 种方式，本地部署，800 tokens/s 的推理速度真的太快了！

北京时间4月19日凌晨，Meta在官网上官宣了Llama-3，作为继Llama1、Llama2和CodeLlama之后的第三代模型，Llama3在多个基准测试中实现了全面领先，性能优于业界同类最先进的模型，你有没有第一时间体验上呢，这篇文章就分享下如何在Groq上以超过 800 tokens/s 的魔鬼推理速度体验Llama3，会同时分享Web端、移动端、API方式以及集成到LangChain中4种体验方案。

我的新书[《LangChain编程从入门到实践》]已经开售！推荐正在学习AI应用开发的朋友购买阅读，本书围绕 LangChain 梳理了AI时代开发范式的转变，除了LangChain，还涉及其他诸如 LIamaIndex、AutoGen、AutoGPT、Semantic Kernel等热门开发框架。

[ LangChain编程从入门到实践

Groq 有多快

先看两组数据

Llama3 8B不同平台的推理速度

Llama3 70B不同平台的推理速度

Llama3 8B 每秒钟 876 tokens 的输出速度，人眼基本跟不上模型的输出速度了，要知道 Llama3 8B 的质量与 GPT-3.5 和 Llama2 70B 相似，可以显著提升一些常见的 AI 应用场景的用户体验；RAG 的性能瓶颈不再是 LLM，而是 Retrieval，什么 HyDE（假设⽂档嵌⼊，利⽤ LLMs ⽣成假设性答案，以增强⽂档检索的准确性）、LLM 重排序器（对检索到的⽂档进⾏重排序，以优先选择最相关和上下⽂适当的信息）不再是 RAG 链路速度瓶颈…

初看数据，我以为是个噱头，本着务实的态度，我自己实际体验了一把，大家自己看 👇

Llama3 8B实测

Llama3 70B实测

结果 Llama3 70B 的实际体验结果比测评数据还高。

Groq 为什么这么快

源于 Groq 开发出了一种新的 AI 处理器 ——LPU（Language Processing Unit），其推理速度相较于英伟达 GPU 提高了 10 倍。

专业优化：LPU 专门针对语言模型推理任务进行了优化，特别是在序列处理方面。
创新架构：LPU 采用了一种新的计算模式，能够高效地按顺序处理任务，而不是并行处理。
软件先行：Groq 在硬件开发前就创新了软件和编译器，以确保芯片间的高效通信。
内存与处理单元的整合：LPU 的设计使得数据流局部性得到更好的利用。
针对性能和成本的优化：LPU 在设计时就注重了性能提升和成本降低。

4 种 Groq 体验方案

1. Web 端

无需登录，即可直接在网页版进行尝试，地址指路 👉[groq.com]，当前支持的模型有 Llama3 8B-4k 、 Llama3 70B-8k 、 Llama2 70B-8k 、 Mixtral 8X7B-32k 、 Gemma 7B-it

2. 移动端

Gorq 的 iOS 应用已经推出，目前不需要登录即可使用，通过下面的 TestFlight 安装地址：[testflight.apple.com]，支持的模型有 Llama3 8B 、 Llama3 70B 、 Llama2 70B 、 Mixtral 8X7B 、 Gemma 7B

Gorq iOS 应用

3. API 调用

先前往这个地址 [console.groq.com/keys] 申请好 API-KEY。

Groq API-Key申请

安装依赖库

pip install groq

调用

import os
from groq import Groqclient = Groq(api_key=os.environ.get("GROQ_API_KEY"),
)
llm = client.chat.completions.create(messages=[{"role": "user","content": "编写一篇中国神话故事，篇幅500～800字，必须使用中文输出",}],model="llama3-70b-8192",
)print(llm.choices[0].message.content)

4. LangChain 中使用

安装依赖库

pip install langchain-groq

使用

from langchain_core.prompts import ChatPromptTemplate
from langchain_groq import ChatGroqllm = ChatGroq(temperature=0, model_name="llama3-70b-8192")
human = "{text}"
prompt = ChatPromptTemplate.from_messages([("human", human)])chain = prompt | llmresponse = chain.invoke({"text": "编写一篇中国神话故事，篇幅500～800字，必须使用中文输出"})
print(response.content)

如何学习AI大模型？

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述