English | 能力参考 | 工作流指南 | 架构说明 | 常见问题
Data Analysis Agent 是一个基于 DeepSeek Harness 的本地优先专业数据分析 Agent。它首先面向学术研究与实证分析,也能扩展到 KPI、cohort、差异分解等商业数据分析任务。它把需求澄清、数据采集、质量核验、统计与计量分析、报告生成、独立验证和最终交付连接成一条可追踪的自适应工作流。
项目的主要强项是有边界、可恢复的网页与公开数据采集,以及把数据质量、统计假设、计量识别、完整结果和可复现交付连在一起的实证分析。
项目的需求与交付方式来自作者说明的两年、约 300 份数据分析委托实践经验。这段经验用于提炼常见研究问题、返工原因、证据边界和交付习惯,不表示这些委托数据被用于训练模型权重,也不表示 300 份项目都已成为公开基准。
- 学术研究:问卷分析、描述统计、组间比较、相关、线性与二元 Logistic 回归、因子诊断、面板模型、双重差分、工具变量和时间序列。
- 科研全流程:从研究问题与数据字典开始,经过数据质量、方法选择、结果解释、图表和多格式报告,保留来源、参数、哈希和限制。
- 参考论文方法蒸馏与迁移:读取用户指定的论文全文,提取研究设计、估计对象、假设、检验与限制,再核对当前数据是否满足迁移条件。方法迁移不是复制论文文字,也不能用论文结论替代当前数据证据。
- 数据采集:为公开网页、表格和接口建立字段、来源、请求、分页、速率和停止预算;支持静态与可选动态页面采集、断点记录、来源快照和部分失败说明。
- 商业分析:建立版本化 KPI 口径,处理多来源字段映射,分析 cohort、漏斗和预算/期间/基准差异,并区分事实、解释和建议。
- 自适应沟通与答辩教学:根据普通用户、实务用户或专家的当前问题调整解释深度,可辅助解释方法选择、结果含义、限制、复现位置和答辩思路,但不改变事实状态。
Agent 不把“学术”“市场”“运营”固化成互斥模式。它先把自然语言需求编译为版本化阶段计划,再根据实际 schema、来源覆盖、统计前提和模型诊断调整后续阶段。
需求与输入
↓
RequirementSpec → 版本化计划 → 数据采集/质量核验
↓
统计 / 计量 / 企业分析
↓
候选报告 → 独立验证 → 最终交付
关键原则:
- 自动化开始前先配置凭据、数据、允许访问的来源与路径、隐私边界,以及请求、时间和模型预算。
- 原始输入进入
input/后按只读证据处理;清洗结果写为新版本,不覆盖原件。 - 计算由受契约约束的 Python Worker 执行,结果引用实际 artifact,不在文字中补造数值。
- 数据、口径或识别条件不足时保持
blocked,给出缺口与可继续步骤,不生成迎合预期的结论。 - 报告先写入
output/candidate/;只有绑定当前候选的独立验证通过并完成交付授权后,才进入output/final/。
当前代码注册了以下操作族:
| 阶段 | Operations |
|---|---|
| 采集 | acquisition.crawl, acquisition.http_table |
| 质量 | quality.profile, quality.clean |
| 统计 | statistics.survey.analyze, statistics.descriptive, statistics.group_compare, statistics.correlation, statistics.regression, statistics.frequency, statistics.contingency, statistics.logistic, statistics.factor_diagnostics |
| 计量 | econometrics.panel, econometrics.did, econometrics.iv, econometrics.timeseries |
| 企业 | enterprise.kpi, enterprise.cohort, enterprise.variance |
| 交付 | delivery.package, validation.verify, delivery.publish |
survey.analyze 作为问卷分析兼容别名保留。完整输入、输出和方法边界见能力参考。
项目内置 14 个核心 Skills,覆盖任务工作区、需求计划、自适应重规划、用户沟通、参考论文蒸馏、数据质量与来源、采集治理、网页采集、统计、计量、企业分析、交付生产、去防御性报告写作与交付验证。运行时先读取目录元数据,仅在已批准阶段按需加载正文,并记录激活版本与内容哈希。
环境要求:Node.js >=22.19.0、通过 Corepack 使用 pnpm 10.23.0、Python >=3.11,以及本地 DeepSeek Harness 运行环境。真实模型调用需要用户自己的凭据。
corepack pnpm install --frozen-lockfile
python -m venv .venv
.\.venv\Scripts\python.exe -m pip install -e ".\python[dev]"
corepack pnpm build
corepack pnpm typecheck
node scripts/doctor.mjs --offline复制 .env.example 为本机 .env 后,填写工作区、Harness home 和必要凭据。不要提交 .env,也不要把密钥写进任务输入或报告。
创建独立任务目录:
corepack pnpm task:new -- --workspace '<工作区绝对路径>' --date 20260914 --slug survey-study --title '问卷研究'公开快照提供构建、类型检查、Doctor、任务创建和发行构建所需源码。完整内部测试、真实 API 验收夹具和私有数据不随公开快照提供,因此不要把公开仓库中的 pnpm test 当作完整验收入口。发行构建产物不会自动上传或发布。
在非系统盘的干净 Git 源码目录中继续执行以下命令;本地构建修改版时可给打包命令添加 --dry-run。安装器要求新的 Profile 名称,已有安装请使用另一个名称,避免覆盖。
.\.venv\Scripts\python.exe -m pip install build==1.3.0 setuptools==80.9.0 wheel==0.45.1
node scripts/package-release.mjs --output dist/local
$projectRoot = (Get-Location).Path
$env:DSH_HOME = Join-Path $projectRoot 'try/tmp/local-harness'
$env:DA_WORKSPACE_ROOT = Join-Path $projectRoot 'try/tmp/local-workspace'
$env:DA_PYTHON = Join-Path $projectRoot '.venv/Scripts/python.exe'
$bundleSource = 'file:' + (Join-Path $projectRoot 'dist/local/data-analysis-profile-0.2.0.tgz').Replace('\', '/')
node scripts/profile-install.mjs --surface web --profile data-analysis-web --bundle-source $bundleSource
$profilePath = Join-Path $env:DSH_HOME 'profiles/data-analysis-web'
npm --prefix $profilePath install --ignore-scripts
$env:DA_PROJECT_ROOT = Join-Path $profilePath 'node_modules/@data-analysis-agent/profile'
New-Item -ItemType Directory -Force $env:DA_WORKSPACE_ROOT | Out-Null
.\scripts\dev.ps1 -Profile data-analysis-web在官方 Web 入口配置自己的模型凭据。.env 是配置账本,启动脚本不会自动加载它;上面的变量显式设置在当前 PowerShell 进程。Headless 安装使用 --surface headless 和独立 Profile 名称,详细安装包流程见安装说明。
我有一份问卷 XLSX 和研究假设。请先核对量表条目、缺失、重复和编码,
再做信度、描述统计、组间差异、相关与回归。完整报告有效样本量、
效应量、置信区间和诊断,生成中文 DOCX、XLSX 与 PDF 候选供我确认。
请按我提供的 DOI 阅读全文,分开列出论文中的研究设计、估计对象、
识别假设和限制,再判断这些方法迁移到当前面板数据还缺哪些字段或检验。
若关键条件不满足,请停止因果解释并给出替代分析方案。
在已批准的公开来源与请求预算内采集行业指标,保留网页快照、来源时间、
失败清单和字段映射;随后计算已确认口径的 KPI、cohort 与差异分解。
- 本项目不能保证论文投稿、答辩或录用结果,也不能替代研究者、导师、伦理审查或领域专家的最终判断。
- 参考论文蒸馏要求可定位的标题、DOI、URL 或本地全文。只有摘要或元数据时会明确降低证据范围,不补写正文细节。
- 网络采集受网站条款、robots、访问权限、验证码、登录态、隐私和预算约束。未获授权的来源或字段不会自动扩大。
- 观察性相关和普通回归不自动产生因果结论。关键识别假设不能支持时,系统应降级为描述或相关结论。
- 自动化依赖用户提供正确数据、字段含义、凭据和权限。缺失关键信息时,预期行为是停止、澄清或重规划。
packages/profile-data-analysis/:Web/Headless Profile、系统提示与 operation catalog。packages/harness-adapter/:隔离 DeepSeek Harness 预发布接口差异。packages/workflow-core/:需求路由、计划 DAG、事件投影、恢复、重规划与分叉。packages/policies/:计划、路径、网络、风险和数据诚信约束。packages/skills-runtime/与skills/core/:核心 Skills 发现、来源校验、按需加载和激活审计。packages/tools/:计划、Worker、采集与交付生命周期工具。python/da_worker/:受路径、格式、时间、输出和内存预算约束的确定性分析 Worker。packages/workspace/与templates/workspace/:多任务工作区生命周期与模板。
本项目建立在 DeepSeek Harness / Cordis 之上;上游运行时与第三方科学计算、文档和字体组件保留各自许可与归属。更多设计说明见架构文档。
本项目以 PolyForm Noncommercial 1.0.0 提供源代码访问,用于该许可允许的非商业目的。商业使用需另行取得商业许可。这是 source-available(源代码可用)项目,不宣称为 OSI 认可的开源软件。
完整许可包含对教育机构、公共研究机构等非商业组织的明确授权,具体适用范围以 PolyForm 原文为准。MIT/OFL 等第三方组件继续适用其原许可;本版本的项目自有 Skills 使用根目录许可。历史版本已授予的 Apache-2.0/MIT 权利不因后续版本变更而撤回。
引用元数据见 CITATION.cff。作者与仓库:q2955161835-debug / Data_analysis_agent。