工具arxiv cs.AI · 5d ago重要

Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

分类释义:开发工具与基础设施

TL;DR

MIT 等团队提出可迁移的 LLM 延迟预测框架,在 Pixel 8 等边缘设备上将解码延迟预测 R² 从 0.957 提升至 0.973,并实现跨设备迁移(Pixel 8 Pro → Pixel 8 R² 达 0.940)。

关键要点

  • 01MIT 等团队提出可迁移的 LLM 延迟预测框架
  • 02在 Pixel 8 等边缘设备上将解码延迟预测 R² 从 0.957 提升至 0.973
  • 03并实现跨设备迁移(Pixel 8 Pro → Pixel 8 R² 达 0.940)
为什么值得关注

部署 LLM 到边缘设备时,手动 profiling 成本极高,该框架通过轻量校准实现跨设备延迟预测,工程师可直接借鉴:构建一个自动化 LLM 筛选工具,根据用户设备的实时硬件状态(DVFS、温度)和 prompt 特征,智能选择最优模型。

对你的工程实践意味着什么

LLM 实时生成MiniMax-M2.7缓存命中
角色你应该做什么
Tech Lead评估将延迟预测能力集成到模型服务网关的技术可行性
应用工程师关注该框架的开源进度,计划在边缘推理模块中加入模型切换逻辑
运维 / 平台暂无直接影响,了解即可
产品 / 业务暂无直接影响,了解即可
阅读原文 ↗来源:arxiv cs.AI

同类资讯

本页 TL;DR 与「为什么」由 LLM 生成 · 模型:MiniMax-M2.7 / Claude Haiku 4.5