docmd-assistant v0.1.16 引入了基于 DOM 的结构化 Markdown 内容提取、无上限上下文窗口传递以实现高质量文档答复、多轮执行云端调用去重以及查询文本的深度净化。
主要特性与增强
结构化 Markdown 内容提取
- 代码块与排版完整保留:内置 DOM 页面读取器(
read_documentation_page)现在将 HTML 页面解析为干净且具结构性的 Markdown 格式。带有语言标签的代码块(pre/code)、各级标题(#–######)、列表项(-)以及段落换行均得到完整保留。 - 页面框架与抽屉组件自动过滤:提取前自动移除与内容无关的页面元素(
nav、aside、header、footer、.toc、.sidebar、.docmd-ai-drawer及[aria-hidden="true"]),确保仅将真实的文档技术内容送入模型。
无上限上下文窗口传递(contextWindow)
- 高保真文档综合理解:移除了
read_documentation_page原有的 3,500 字符限制,允许助手完整读取整篇参考文档、大型配置表格及详细示例。 - 可配置上下文限制:在
AssistantOptions中新增contextWindow选项(默认为0/ 不设上限直接传递全部检索结果),取代原先硬编码的 15,000 字符上限,同时按需支持 Token 用量控制。
多轮中继与分析统计优化
- 工具执行轮次标记(
isToolFollowUp):在自主多轮循环的后续请求中自动附带isToolFollowUp: true。这使得云端中继与统计后台能够准确区分用户初始提问与内部工具调用,避免重复计入访客提问指标。 - 查询清理与多余引号去除:从
originalUserQuery中彻底剥离注入的检索提示块(\n\n[Documentation Search Context...]),并移除外部引号,杜绝了聊天日志数据库中残留孤立前导引号的问题。
已解决的问题
- 云端统计重复记录:修复了在自主调用工具(如检索后读取文档)时,内部轮次被重复记为访客新查询的问题。
- 孤立前导引号(
"):修复了正则清洗逻辑导致访客问题前附带未闭合双引号的问题。 - 代码块丢失缩进:修复了页面读取器提取代码片段时格式被压缩为单行的问题。
升级指南
npm
pnpm
npm install docmd-assistant@0.1.16
pnpm add docmd-assistant@0.1.16