← 返回历史研报
LEGACY REPORT / #860宏观分析

2026.3.25Agent 专题报告

报告摘要SUMMARY
  1. MiroFish 是 2025 年 12 月发布、2026 年 3 月登顶 GitHub 全球趋势榜榜首的开源 AI 预测引擎,定位 “简洁通用的群体智能引擎”,核心通过构建高保真平行数字世界实现宏观与行业趋势推演,技术架构深度融合时序 GraphRAG、多智能体系统与 OASIS 仿真引擎,支持商业决策预演与创意仿真。
  2. 其采用 “数字孪生社会” 架构,为多智能体并行计算集群,核心运行机制为:用户输入种子材料和模拟提示词→图谱构建引擎生成 GraphRAG 知识网络→智能体工厂生成 N 个独立人格智能体→双轨仿真环境推演→涌现检测器捕捉群体行为模式→生成结构化预测报告。
  3. 输入环节:用户传入涵盖黄金驱动框架、2026 年关键事件等八项内容、7209 字的 “种子文件”,以及明确金价季度区间、历史周期对比等预测问题的模拟提示词。
  4. AI 产业促进条例分析:提取 34 个实体节点、29 条关系边,生成 14 个不同角色 Agent,92 次交互围绕政策受益方等展开,报告预判了产业链传导路径和资金流向。
约 7 分钟历史公开研报原始页面 ↗

1 MiroFish 是什么?

1.1 MiroFish 机制简介

MiroFish 是 2025 年 12 月发布、2026 年 3 月登顶 GitHub 全球趋势榜榜首的开源 AI 预测引擎,定位 “简洁通用的群体智能引擎”,核心通过构建高保真平行数字世界实现宏观与行业趋势推演,技术架构深度融合时序 GraphRAG、多智能体系统与 OASIS 仿真引擎,支持商业决策预演与创意仿真。

其采用 “数字孪生社会” 架构,为多智能体并行计算集群,核心运行机制为:用户输入种子材料和模拟提示词→图谱构建引擎生成 GraphRAG 知识网络→智能体工厂生成 N 个独立人格智能体→双轨仿真环境推演→涌现检测器捕捉群体行为模式→生成结构化预测报告。

图谱构建依赖 Zep Cloud 的时序关系记忆服务,可提取实体与关系并注入记忆;环境搭建会将知识图谱节点转化为拟人化 Agent,为其配置年龄、MBTI 等多维度属性并设定仿真规则;仿真执行在模拟的 X 和 Reddit 平台并行开展,Agent 行为会实时更新至 Zep 图谱;报告生成采用 ReACT 范式,调用 insight_forge、panorama_search、interview_agents 工具集,整合双平台数据后输出含事件脉络、风险预警等模块的结构化报告。

1.2 MiroFish 工作流程

以黄金 2026 年走势分析为案例,展现了 MiroFish 完整工作流程:

  • 输入环节:用户传入涵盖黄金驱动框架、2026 年关键事件等八项内容、7209 字的 “种子文件”,以及明确金价季度区间、历史周期对比等预测问题的模拟提示词;
  • 图谱与智能体生成:模型从种子材料中提取政府部门、金融机构等实体及工作、合作等关系,自动生成 60 个具备基本信息、人设简介、关联话题的 Agent,其基本信息为随机生成,与现实或种子文件可能不符;
  • 仿真互动:60 个 Agent 在模拟的信息广场和话题社区中完成 72 轮互动,包含发表观点、回复、点赞等行为;
  • 报告生成:输出黄金走势预测报告,核心结论为 2026 年黄金已从 “抗通胀工具” 蜕变为 “主权信用对冲工具”,走势将以宽幅震荡代替深幅回调,寻找更高历史中枢;
  • 后续交互:支持与报告 Agent、个体 Agent 对话及发送问卷调查,可实现深度归因、虚拟访谈、了解不同立场观点等功能。

同时该案例暴露其封闭环境局限:极度依赖种子文件准确性,若存在事实错误会持续放大偏差,且无法自主检索外部信息验证补充;但补充现实事实信息后,模型可进行修正推演,也能对未来假设情景展开逻辑详实的分析。

将该案例中 MiroFish 的输出与 Kimi K2.5 的回答对比,经 ChatGPT 评价打分,MiroFish 报告强在宏大叙事性,历史、政策、宏观研究深度更高,逻辑演化与闭环表现好,但偏定性、价格预测模糊、可交易性弱;Kimi K2.5 回答更偏向交易导向,价格预测明确、有量化概率与幅度、可交易性强,整体打分更高。

2 MiroFish 能力测评

2.1 基础能力测评

通过 Claude Code 设计 5 个实验完成 MiroFish 基础能力测评,整体表现为知识图谱构建、Agent 设计能力优秀,端到端流程自动化效果较好,预测报告信息丰富,多元视角模拟有效,具体实验结果为:

  • 知识图谱构建质量测试:对结构化、半结构化及非结构化的社交媒体文本均有良好处理能力,能准确提取实体与语义关系;
  • Agent 画像生成多样性测试:角色、人设深度、关系网络表现优秀,但 MBTI 类型集中,年龄 / 性别多样性不足;
  • 预测一致性分析:多次运行核心结论和框架保持一致,细节表述存在合理差异;
  • 输入敏感性测试:可复现性良好,输入微调后图谱规模变化小,Agent 行为和报告长度有明显响应,对输入变化具备适度敏感性;
  • Agent 采访与深度对话测试:对话质量出色,人设一致性强,能呈现丰富的多元视角。

2.2 金融任务测评

设计 AI 产业政策、大类资产配置、地缘冲突推演、科技路径预测四大金融场景实验,验证 MiroFish 在投资决策相关场景的预测价值,各场景表现如下:

  • AI 产业促进条例分析:提取 34 个实体节点、29 条关系边,生成 14 个不同角色 Agent,92 次交互围绕政策受益方等展开,报告预判了产业链传导路径和资金流向;
  • 2026Q2 大类资产配置预测:提取 48 个节点、50 条边,84 次交互体现多空博弈,报告系统分析了资产相对强弱、风险因子和配置策略方向;
  • 美以对伊军事冲突推演:Agent 交互行为最活跃,共 124 个,报告涵盖冲突烈度、原油价格冲击、避险资产反应等核心内容,分析深度最高;
  • 从 LLM 到具身智能的科技路径预测:耗时最长、Agent 行为数最多(164 个),技术路线争论引发广泛互动,报告对技术拐点、产业链价值重分配等提供多角度分析。

2.3 基模型效果测评

选用 Qwen 3.5-plus 和 Claude Opus 4.6 作为 MiroFish 的基模型,在四大金融场景完成对比测试,由独立的 Claude Code 评估效果,核心差异体现在:

  • 基本指标:Claude Opus 4.6 在所有场景中运行速度均显著快于 Qwen 3.5-plus,图谱构建更精简,Agent 交互行为数略多;Qwen 3.5-plus 构建的知识图谱节点和边数更多,生成的报告整体更长;
  • 报告质量:Qwen 3.5-plus 的优势体现在数据密度高、投资可操作性强、结论具象化;Claude Opus 4.6 则在因果推演能力、结构化分析、信息诚实度、语言一致性方面表现更优。

3 总结

  • MiroFish 已实现 AI 群体交互涌现的基本架构,生成的智能体层次丰富、架构合理,但受 Token 成本约束,Agent 交互的次数和深度难以在大规模模拟下保障效果,且 Agent 细节尚未达到 “数字孪生” 的精细度,适用于对精确度要求不高的模拟预测场景;
  • MiroFish 生成的报告在质量上未显著优于联网 LLM,但具备更强的叙事性和更完整的逻辑闭环,不过其封闭模拟环境易放大种子文件的偏误信息,对种子文件的准确性和完整性要求较高,更适合用于分析逻辑的启发、查漏与推演;
  • 在金融领域,MiroFish 的叙事性和逻辑闭环优势使其适用于宏观研究中的政策影响分析、资产驱动分析等需要反复推敲的工作,也可用于产业趋势研究中技术路线、价值链可能性的详细排查,其内置的对话机制支持多情景推演,能为用户开展 “沙盒” 测试提供灵活工具支持。

4 风险提示

  • 模型存在信息封闭性与推演偏差风险:MiroFish 为封闭环境模拟,无法自主检索外部信息验证种子文件准确性,若输入材料存在错误或信息缺口,Agent 交互可能持续放大偏差,形成 “逻辑自洽但事实错误” 的群体幻觉;同时智能体的涌现行为存在随机性,可能产生情绪化或非理性的一致性偏差;
HISTORICAL ARCHIVE / 2026.03.25本文为冻结的历史归档,不再更新。
全文检索

查找信息

搜索索引将在首次使用时加载。