方法摘要
填写地区与行业
生成3道问题
调用9个模型
证据识别与复核
规则评分与报告
核心原则:被测问题不包含企业名称;成功回答保留原文;客观指标由规则计算;模型评估用于解释和证据复核;失败调用单独披露。
第一步:使用哪些输入
| 信息 | 用途 | 是否发送给被测模型 |
|---|---|---|
| 地区、行业、细分品类、目标客户 | 生成接近业务场景的推荐问题 | 是 |
| 企业名称及简称 | 回答完成后识别是否被提及 | 否 |
| 联系人、电话 | 订单服务、报告通知和经授权的后续联系 | 否 |
| 公开资料或参考链接 | 帮助评估描述准确性和提出整改方向 | 仅在相应功能明确说明时使用 |
第二步:怎样生成3道问题
前置规划模块根据行业标准、地区和品类生成3类问题,通常覆盖开放推荐、条件比较和风险/筛选场景。当前规划模型为 DeepSeek V4 Pro;产品可能因可用性调整版本,实际配置会记录在报告或接口目录中。
问题设计目标是接近潜在客户的自然表达,而不是在题目里提示企业名称。为了进行趋势复测,建议保留问题、地区、行业、日期和模型版本。
第三步:9模型并行检测
每道问题分别发送给9个模型,计划调用数为3 × 9 = 27。当前模型系列包括 DeepSeek、豆包、MiniMax、Kimi、通义千问、腾讯混元、智谱 GLM、文心一言和阶跃星辰。
计划调用数 = 问题数 3 × 模型数 9 = 27
有效样本数 = 实际成功返回且可解析的回答数
调用失败 ≠ 企业未被提及
有效样本数 = 实际成功返回且可解析的回答数
调用失败 ≠ 企业未被提及
模型回答存在随机性,也可能因版本更新、联网能力、上游限流或服务故障发生变化。
第四步:证据评估与规则评分
回答完成后,后置评估模块使用企业名称、简称和公开资料识别提及证据、描述是否匹配、推荐上下文及同行信息。当前评估模型为 Qwen3.7 Plus。最终客观分数由规则引擎计算,评估模型负责解释和证据复核。
| 指标 | 关注内容 | 解释边界 |
|---|---|---|
| AI可见度 | 成功回答中企业被识别和提及的情况 | 只代表本次样本,不代表所有用户问题 |
| 信息准确度 | 回答中的主体、服务、地区等描述是否与公开事实一致 | 依赖企业提供及公开可核验资料 |
| 同行竞争力 | 企业与同一回答中其他候选的相对表现 | 不是市场份额或官方行业排名 |
| 公开信源 | 官网与外部公开信息的完整性、清晰度和一致性 | 数量不等于质量,需人工核验来源 |
| 口碑安全 | 回答是否出现风险、负面或需谨慎核验的表述 | 不构成法律、征信或事实认定 |
| 转化承接 | 官网、产品信息、联系方式等是否便于用户继续核验或咨询 | 不等于实际成交概率 |
推荐状态怎么理解
| 状态 | 一般含义 |
|---|---|
| 明确推荐 | 回答把企业作为直接候选或建议对象,仍需核对上下文和条件。 |
| 附条件推荐 | 企业被列为候选,但回答附带地区、预算、资质或适用范围等条件。 |
| 仅提及 | 回答出现企业名称,但没有形成明确推荐。 |
| 负面筛除 | 回答出现风险、否定或不建议表述,应优先核对事实与来源。 |
| 未提及 | 本次成功回答没有识别到企业名称或简称,不等于所有AI回答都不会提到。 |
失败与异常怎样处理
- 连接超时、上游错误、空回答或无法解析的调用标记为失败。
- 失败调用不应进入“未提及”分母,报告同时展示计划数、成功数和失败数。
- 样本过少时,结论可信度下降,应更换时间或重新运行。
- 重要结论必须回看原始回答,不仅看总分。
正确的复测方式
- 保存基线日期、问题、地区、行业、模型与版本。
- 完成企业事实、官网内容、结构化数据和第三方信源整改。
- 间隔固定周期,用相同或语义接近的问题复测。
- 比较成功样本、提及证据、描述准确性、引用来源和实际转化。
- 记录模型版本变化,不把单次波动当成长期趋势。
结果不代表什么
企见智镜报告不是AI厂商官方排名,不是全网事实认证,不代表未来回答,不保证优化后必然获得提及或推荐,也不替代医疗、法律、财务、投资等持证专业意见。检测结果应结合原始回答和企业真实经营信息使用。
方法版本:industry-cn-v1.1;页面最后更新:。如需核验当前模型与服务状态,请查看产品详情或联系客服 15575003969。