研究论文
vLLM Semantic Router: Signal Driven Decision Routing for Mixture-of-Modality Models
vLLM Semantic Router Team · arXiv 技术报告
The Workload-Router-Pool Architecture for LLM Inference Optimization: A Vision Paper from the vLLM Semantic Router Project
Huamin Chen, Xunzhuo Liu, Bowei He, Fuyuan Lyu, Yankai Chen, Xue Liu, Yuhan Liu, Junchen Jiang · arXiv 技术报告
Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents
Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen · arXiv 技术报告
Outcome-Aware Tool Selection for Semantic Routers: Latency-Constrained Learning Without LLM Inference
Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu · arXiv 技术报告
Adaptive Vision-Language Model Routing for Computer Use Agents
Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen · arXiv 技术报告
98× Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router
Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen · arXiv 技术报告
inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference
Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu · arXiv 技术报告
FleetOpt: Analytical Fleet Provisioning for LLM Inference with Compress-and-Route as Implementation Mechanism
Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu · arXiv 技术报告
The 1/W Law: An Analytical Study of Context-Length Routing Topology and GPU Generation Gains for LLM Inference Energy Efficiency
Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu · arXiv 技术报告
Conflict-Free Policy Languages for Probabilistic ML Predicates: A Framework and Case Study with the Semantic Router DSL
Xunzhuo Liu, Hao Wu, Huamin Chen, Bowei He, Xue Liu · arXiv 技术报告
From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification
Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu · arXiv 技术报告
Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents
Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen · arXiv 技术报告
Fast and Faithful: Real-Time Verification for Long-Document Retrieval-Augmented Generation Systems
Xunzhuo Liu, Bowei He, Xue Liu, Haichen Zhang, Huamin Chen · SIGIR 2026 Industry Track
Token-Budget-Aware Pool Routing for Cost-Efficient LLM Inference
Huamin Chen, Xunzhuo Liu, Junchen Jiang, Bowei He, Xue Liu · arXiv 技术报告
When to Reason: Semantic Router for vLLM
Chen Wang, Xunzhuo Liu, Yuhan Liu, Yue Zhu, Xiangxi Mo, Junchen Jiang, Huamin Chen · NeurIPS - MLForSys
Category-Aware Semantic Caching for Heterogeneous LLM Workloads
Chen Wang, Xunzhuo Liu, Yue Zhu, Alaa Youssef, Priya Nagpurkar, Huamin Chen
Semantic Inference Routing Protocol (SIRP)
Huamin Chen, Luay Jalil · 互联网工程任务组(IETF)
Multi-Provider Extensions for Agentic AI Inference APIs
H. Chen, L. Jalil, N. Cocker · Internet Engineering Task Force (IETF) - Network Management Research Group
会议演讲
Intelligent LLM Routing: A New Paradigm for Multi-Model AI Orchestration in Kubernetes
Chen Wang, Huamin Chen · KubeCon NA 2025
vLLM Semantic Router: Unlock the Power of Intelligent Routing
Xunzhuo Liu · vLLM Meetup Beijing
AI-Powered vLLM Semantic Router
Huamin Chen · vLLM Office Hours