查看: 18|回复: 0

大模型回答之前,每段提示词都得先切成 token,上下文越长这一步越耗时,Agent 这类长对话尤其明显。

[复制链接]

13

主题

0

回帖

39

积分

新手上路

积分
39
发表于 昨天 22:53 | 显示全部楼层 |阅读模式
大模型回答之前,每段提示词都得先切成 token,上下文越长这一步越耗时,Agent 这类长对话尤其明显。

Hugging Face 团队开源的分词库 tokenizers 已经有 11000+ Star,最近还发了 1.0 的候选版,底层大改了一轮。

官方测下来,单线程比旧版 0.23 快 3 到 30 倍,一份 512 字节的英文文档,延迟从 110 微秒降到 7 微秒,内存占用也降了 2.8 倍。

这版把非拉丁语言也当成了性能目标,中文吞吐提升 6.8 倍,印地语、阿姆哈拉语到了十几倍,这点有点意外。

GitHub:http://github.com/huggingface/tokenizers

核心用 Rust 写,Python 和 Node.js 都能直接调。推理和训练拆成了独立模块,线上服务只装推理那部分,体积小不少。

对 CPU 也没有特殊要求,2008 年以后的 x86 机器都能跑,苹果这类 ARM 芯片上也做了专门加速。

自己部署模型服务、在意首个字出来有多快的,可以换上测一测。


本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部