2024年4月18日中午,Meta AI发布了其最新的大型语言模型(LLM)Llama 3。 2024年4月19日午夜,Groq宣布其LPU™推理引擎已经部署了Llama 3的8B(8千字)和70B(4千字和8千字)版本,并且这些模型已经向开发者社区开放,可以通过groq.com和GroqCloud™控制台访问。
Groq为Llama 3 70B提供的性能是每秒284 tokens,比其他提供商快3到11倍。 对于延迟(从接收到第一个tokens块所需的秒数)与吞吐量(每秒tokens数)的比较,Groq的延迟为0.3秒,吞吐量为每秒282 tokens。 以接收100个tokens输出所需的时间来衡量,通过延迟和吞吐量指标计算,Groq的总响应时间为0.6秒。
