--- name: scholar-evaluation description: 使用ScholarEval框架系统评估学术工作,在研究质量维度(包括问题表述、方法论、分析和写作)提供结构化评估,包含定量评分和可操作反馈。 license: MIT license required_environment_variables: [{"name": "OPENROUTER_API_KEY", "prompt": "OpenRouter API key for the skill's LLM-powered steps.", "required_for": "optional features"}] metadata: {"version": "1.1", "skill-author": "K-Dense Inc.", "openclaw": {"primaryEnv": "OPENROUTER_API_KEY", "envVars": [{"name": "OPENROUTER_API_KEY", "required": false, "description": "OpenRouter API key for the skill's LLM-powered steps."}]}} --- # 学术评估 ## 概述 应用ScholarEval框架系统评估学术和研究工作。此技能基于同行评审的研究评估标准提供结构化评估方法,能够对学术论文、研究提案、文献综述和学术写作进行多质量维度的全面分析。 ## 何时使用此技能 当您需要以下操作时,应使用此技能: - 评估研究论文的质量和严谨性 - 评估文献综述的全面性和质量 - 审查研究方法设计 - 评分数据分析方法 - 评估学术写作和呈现 - 为学术工作提供结构化反馈 - 根据既定标准对研究质量进行基准测试 - 评估目标期刊的发表准备情况 - 提供定量评估以补充定性同行评审 ## 科学示意图的视觉增强 **使用此技能创建文档时,始终考虑添加科学图表和示意图以增强视觉沟通。** 如果您的文档尚未包含示意图或图表: - 使用**scientific-schematics**技能生成AI驱动的 publication 质量图表 - 只需用自然语言描述您想要的图表 - Nano Banana Pro将自动生成、审查和完善示意图 **对于新文档:** 默认应生成科学示意图,以可视化方式表示文本中描述的关键概念、工作流程、架构或关系。 **如何生成示意图:** ```bash python scripts/generate_schematic.py "your diagram description" -o figures/output.png ``` AI将自动: - 创建具有适当格式的 publication 质量图像 - 通过多次迭代进行审查和完善 - 确保可访问性(色盲友好,高对比度) - 将输出保存在figures/目录中 **何时添加示意图:** - 评估框架图 - 质量评估标准决策树 - 学术工作流程可视化 - 评估方法流程图 - 评分标准可视化 - 评估过程图 - 任何受益于可视化的复杂概念 有关创建示意图的详细指导,请参考scientific-schematics技能文档。 --- ## 评估工作流程 ### 步骤1:初始评估和范围定义 首先确定要评估的学术工作类型和评估范围: **工作类型:** - 完整研究论文(实证、理论或综述) - 研究提案或协议 - 文献综述(系统、叙述或范围界定) - 论文或学位论文章节 - 会议摘要或短论文 **评估范围:** - 全面(所有维度) - 针对性(特定方面如方法论或写作) - 比较性(与其他工作进行基准测试) 如果范围不明确,请要求用户澄清。 ### 步骤2:基于维度的评估 系统评估工作的ScholarEval维度。对于每个适用维度,评估质量,识别优势和劣势,并在适当情况下提供评分。 请参考`references/evaluation_framework.md`获取每个维度的详细标准和评分标准。 **核心评估维度:** 1. **问题制定与研究问题** - 研究问题的清晰度和具体性 - 理论或实践意义 - 可行性和范围适当性 - 新颖性和贡献潜力 2. **文献综述** - 覆盖的全面性 - 批判性综合与单纯总结 - 研究空白的识别 - 来源的时效性和相关性 - 适当的情境化 3. **方法论与研究设计** - 对研究问题的适当性 - 严谨性和有效性 - 可重复性和透明度 - 伦理考虑 - 局限性的承认 4. **数据收集与来源** - 数据的质量和适当性 - 样本大小和代表性 - 数据收集程序 - 来源的可信度和可靠性 5. **分析与解释** - 分析方法的适当性 - 分析的严谨性 - 逻辑连贯性 - 考虑替代解释 - 结果-主张一致性 6. **结果与发现** - 呈现的清晰度 - 统计或定性严谨性 - 可视化质量 - 解释准确性 - 影响讨论 7. **学术写作与呈现** - 清晰度和组织性 - 学术语调和风格 - 语法和机制 - 逻辑流程 - 对目标受众的可访问性 8. **引用与参考文献** - 引用完整性 - 来源质量和适当性 - 引用准确性 - 观点平衡 - 遵守引用标准 ### 步骤3:评分与评级 对于每个评估维度,提供: **定性评估:** - 关键优势(2-3个具体点) - 需要改进的领域(2-3个具体点) - 关键问题(如有) **定量评分(可选):** 适当时使用5分制: - 5:优秀 - 典范质量,可在顶级期刊发表 - 4:良好 - 质量强,需要小幅改进 - 3:足够 - 可接受质量,有明显需要改进的领域 - 2:需要改进 - 需要重大修订 - 1:差 - 存在需要重大修订的根本问题 要以编程方式计算综合评分,请使用`scripts/calculate_scores.py`。 ### 步骤4:综合总体评估 提供综合评估摘要: 1. **整体质量评估** - 对工作学术价值的整体判断 2. **主要优势** - 跨维度的3-5个关键优势 3. **关键劣势** - 需要关注的3-5个主要领域 4. **优先建议** - 按影响排序的改进列表 5. **发表准备情况**(如适用)- 对目标期刊的适合性评估 ### 步骤5:提供可操作的反馈 将评估结果转化为建设性、可操作的反馈: **反馈结构:** - **具体** - 引用确切的章节、段落或页码 - **可操作** - 提供具体的改进建议 - **优先排序** - 按重要性和可行性对建议进行排序 - **平衡** - 在解决弱点的同时承认优势 - **基于证据** - 以评估标准为基础提供反馈 **反馈格式选项:** - 带有维度分析的结构化报告 - 映射到特定文档部分的注释评论 - 带有关键发现和建议的执行摘要 - 与基准标准的比较分析 ### 步骤6:情境考虑 根据以下因素调整评估方法: **发展阶段:** - 早期草稿:关注概念和结构问题 - 高级草稿:关注完善和润色 - 最终提交:全面质量检查 **目的和期刊:** - 期刊文章:对严谨性和贡献的高标准 - 会议论文:平衡新颖性和呈现清晰度 - 学生作业:以发展为重点的教育反馈 - 资助提案:强调可行性和影响 **学科特定规范:** - STEM领域:强调可重复性和统计严谨性 - 社会科学:平衡定量和定性标准 - 人文学科:关注论证和学术解释 ## 资源 ### references/evaluation_framework.md 每个ScholarEval维度的详细评估标准、评分标准和质量指标。进行评估时加载此参考以访问特定评估指南和评分标准。 快速访问的搜索模式: - "Problem Formulation criteria" - "Literature Review rubric" - "Methodology assessment" - "Data quality indicators" - "Analysis rigor standards" - "Writing quality checklist" ### scripts/calculate_scores.py 用于从维度级别评级计算综合评估分数的Python脚本。支持加权平均、阈值分析和分数可视化。 用法: ```bash python scripts/calculate_scores.py --scores --output ``` ## 最佳实践 1. **保持客观性** - 基于既定标准而非个人偏好进行评估 2. **全面评估** - 系统评估所有适用维度 3. **提供证据** - 用工作中的具体例子支持评估 4. **保持建设性** - 将弱点框定为改进机会 5. **考虑情境** - 根据工作阶段和目的调整期望 6. **记录理由** - 解释评估和评分背后的推理 7. **鼓励优势** - 明确承认工作的优点 8. **优先排序反馈** - 首先关注高影响改进 ## 评估工作流程示例 **用户请求:** "评估这篇关于机器学习用于药物发现的研究论文" **响应过程:** 1. 确定工作类型(实证研究论文)和范围(全面评估) 2. 加载`references/evaluation_framework.md`获取详细标准 3. 系统评估每个维度: - 问题制定:关于ML模型性能的清晰研究问题 - 文献综述:全面覆盖最近的ML和药物发现工作 - 方法论:适当的深度学习架构和验证程序 - [继续评估所有维度...] 4. 计算维度分数和整体评估 5. 将发现综合为结构化报告,突出: - 强大的方法论和可重现的代码 - 需要更多多样化的数据集评估 - 写作可以提高结果部分的清晰度 6. 提供按优先级排序的具体建议 ## 与科学写作器集成 此技能与科学写作工作流程无缝集成: **论文生成后:** - 使用学术评估作为同行评审的替代或补充 - 与`PEER_REVIEW.md`一起生成`SCHOLAR_EVALUATION.md` - 提供定量分数以跟踪修订过程中的改进 **修订期间:** - 在解决反馈后重新评估特定维度 - 跟踪多个版本的分数改进 - 识别需要关注的持续弱点 **发表准备:** - 评估目标期刊/会议的准备情况 - 在提交前识别差距 - 根据发表标准进行基准测试 ## 注意事项 - 评估严谨性应与工作的目的和阶段相匹配 - 某些维度可能不适用于所有工作类型(例如,纯理论论文的数据收集) - 应考虑学术规范的文化和学科差异 - 此框架补充而非替代特定领域的专业知识 - 与同行评审技能结合使用以进行全面评估 ## 引用 此技能基于ScholarEval框架,该框架在以下文献中介绍: **Moussa, H. N., Da Silva, P. Q., Adu-Ampratwum, D., East, A., Lu, Z., Puccetti, N., Xue, M., Sun, H., Majumder, B. P., & Kumar, S. (2025).** _ScholarEval: Research Idea Evaluation Grounded in Literature_. arXiv preprint arXiv:2510.16234. [https://arxiv.org/abs/2510.16234](https://arxiv.org/abs/2510.16234) **摘要:** ScholarEval是一个检索增强评估框架,基于两个基本标准评估研究想法:合理性(基于现有文献的拟议方法的经验有效性)和贡献(该想法相对于先前研究在不同维度上的进步程度)。该框架实现了对专家注释评估点的显著更高覆盖率,并且在评估可操作性、深度和证据支持方面始终优于基线系统。