
Qwen-Agent 流式输出接入 vLLM 本地教程【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent在 Qwen-Agent 的代码解释器里输入一个任务屏幕上 Thought、代码和饼图逐行长出来——这是框架接入本地 vLLM 模型服务并打开流式输出通道后的效果。 先看效果服务跑起来后你看到的第一眼不是转圈等待。提交任务后Chatbot 的回答、Thought 与 Action 代码在浏览器里实时渲染写作工作台默认端口 7864里的长文也是一段一段长出来。这个效果不依赖任何云 API背后是 OpenAI 协议的 stream 开关模型每生成一个 token服务端就立刻推一条增量消息。代码解释器与网页问答共用同一套增量返回机制整个接入只有三步。图1代码解释器中 Thought、Action、Observation 实时呈现代码执行后图表随即出现它解决了什么问题为什么请求-等待-全量返回会很慢传统批量模式只有一条路请求、等待、拿到完整结果。当一次回答包含数百行代码时用户在整段生成时间里看不到任何进度回答越长等待感越重前端请求甚至可能先超时。streamTrue 的增量推送机制OpenAI 协议自带 stream 开关。Qwen-Agent 的 oai 模型类型调用服务端时打开这个开关拿到的响应是一个迭代器——模型每生成一个 token前端就收到一个增量块。同一个循环里有两种发法delta_streamTrue只发新增片段False则每次发送累积至今的完整内容适合要求上下文完整的场景。具体实现见流式输出核心实现。 动手接入第一步启动 vLLM 服务pip install vllm python -m vllm.entrypoints.openai.api_server \ --model Qwen/Qwen2.5-7B-Instruct \ --host 0.0.0.0 --port 8000这条命令在本地 8000 端口起一个 OpenAI 兼容端点对外地址即http://localhost:8000/v1。第二步把 Qwen-Agent 指到这个服务python run_server.py \ -m http://127.0.0.1:8000/v1 \ -k EMPTY \ -l Qwen/Qwen2.5-7B-Instruct-m是服务地址-k是密钥本地服务无需真实密钥填EMPTY即可-l是模型名。执行后这些值会写回服务端配置文件也可以直接改其中的model_server、api_key、llm三个字段。第三步打开浏览器验证流式效果访问http://127.0.0.1:7864的写作工作台提交一个任务。看到长文在编辑器里一段一段长出来说明流式输出已生效。图2写作工作台的长文逐段在编辑器中生长思考过程与正文并排展示在代码里效果一致对bot.run(messages)的返回值做增量迭代就能拿到一条条增量消息examples 目录下的示例脚本演示了同样的写法。实测表现与取舍场景传统模式优化后差异首条文字出现时机模型生成完全部内容后第一个 token 生成后立即感知等待从整段生成时间缩到首 token 时间单次响应形态一次性完整消息按 token 分块的增量消息前端随到随渲染工具调用过程中间过程要等全量返回推理过程增量推送工具参数逐块拼接ReAct 风格智能体可逐行展示思考链流式的收益主要体现在感知侧token 生成的总时长不变出字速度仍由推理引擎和 GPU 决定。图3代码解释器生成并执行 Python 代码工具调用的中间过程可实时看到需要付出的代价两种发送模式不能随意互换。完整模式delta_streamFalse每次累积整段文本消息体积随回答长度增长前端渲染要整体替换超长输出时默认的增量模式更稳。vLLM 是面向 GPU 的推理引擎本地部署需要兼容的 CUDA 环境纯 CPU 机器可换 Ollama 等 OpenAI 兼容服务走同一个 oai 模型类型即可。多轮对话的流式消息中还包含推理过程reasoning_content前端若不区分字段思考文本和最终回答会混在同一框里。避坑 FAQQwen3 的工具调用参数要不要加用 vLLM 部署 Qwen3 或 QwQ 时不要加--enable-auto-tool-choice和--tool-call-parser hermes两个参数因为 Qwen-Agent 会自行解析工具输出加了反而重复解析Qwen3-Coder 则相反建议开启内建解析并搭配use_raw_api参数。详见README_CN 的模型服务说明。连接被拒或 401 怎么排查model_server要填到/v1结尾的完整端点启动脚本会把0.0.0.0自动改写成127.0.0.1。本地服务不需要真实密钥-k填EMPTY即可端口连不上时先确认 vLLM 进程是否成功拉起。接入本地 vLLM 后流式输出不再是云服务的专属能力Qwen-Agent 指向任意 OpenAI 兼容端点即可复用整套增量渲染链路。延伸路径流式实现源码、服务端默认配置。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考