METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

AI 术语词典ㅇ报道中常见的技术词

端到端延迟

End-to-End Latency

指从发送请求的那一刻起,到完全收到回答为止所花费的全部时间。

简单来说

端到端延迟指的是从发送请求那一刻起,到完全拿到想要的结果为止所经过的全部时间。这就像在餐厅点餐后,从厨房烹饪到最终上菜、食物摆在你面前的那一刻为止的整个过程所用的时间。哪怕厨房做菜再快,如果上菜慢了,顾客感受到的等待时间依然很长。

在AI服务中,这段时间会被拆分成好几个阶段:请求到达服务器(或设备)并开始处理所需的时间、生成答案所需的时间,以及把生成的答案传送到屏幕上所需的时间,这些时间依次叠加。所以并不是某一个环节变快了整体就会变快,只有把从头到尾的整个过程作为一个整体来测量,才能知道用户实际感受到的速度。

尤其是在手机或笔记本电脑上直接运行AI模型时,这段时间会变得更加重要。因为处理过程必须在设备内部完成,而不经过互联网服务器,所以即使是同一个模型,采用什么压缩方式、加载到什么运行环境上,都会让端到端延迟出现很大差异。

在报道中是这样出现的

文章中通常用"输入1,024个token的提示词,得到256个token的回答需要多少秒"这样的方式来说明这个概念。这里常见的误解是以为只要答案开始出现得快就行,但端到端延迟指的并非答案第一个字出现的时间,而是整个答案完成所需的时间。

亲手试一试

在聊天机器人应用中输入任意问题,从按下发送键的那一刻开始计时,直到回答完全停止为止。再把同一个问题缩短或延长后重新计时,你就能体会到请求长度和回答长度如何影响整体所需时间。

相关词条

出现过这个词的报道

浏览全部词条