任务必须来自真实工作流
病例、影像、检验、指南和研究数据不是预先整理好的题干,而是智能体在完成任务过程中需要主动识别、调用和整合的原始信息。
您只需说明真实诊疗或医学研究中的任务目标、原始资料、专业操作和交付要求。技术团队会将其整理为可执行、可核验、可复现的智能体任务。
病例、影像、检验、指南和研究数据不是预先整理好的题干,而是智能体在完成任务过程中需要主动识别、调用和整合的原始信息。
任务数据既可来自脱敏的真实临床或科研数据,也可通过公开数据集、开源数据库与文献资料整合构建,无需直接提供敏感患者信息。
不仅要定义最终交付结果,还要明确关键中间产物、通过标准、不可接受的错误,以及必须由专业人员接管的高风险情形。
关键区别
目标不是只考 AI 知道什么,而是检验它能否安全、完整、可追溯地完成真实医疗工作。
传统问答 · 单点
信息一次给全,答案通常是一个诊断、选项或知识点。
“患者头痛伴视物模糊,最可能的诊断是?”
CALE 任务 · 综合判断
需要理解不同信息怎样相互补充或约束,经过若干关键判断形成结果,并在风险、冲突或证据不足时请求人工确认。
描述任务的方法
选择一项真实发生、边界明确、能够形成具体结果的临床或科研工作。说明任务处理什么对象、解决什么问题,以及结果将用于什么后续决策或研究。
可以用一句话回答:“给我哪些对象和资料,我需要完成什么专业工作,结果用于什么?”
基于一批胸部 CT、病历与检验资料,识别肺结节,完成病灶测量和风险分层,并形成可供临床复核的结构化评估结果。
列出完成任务所需的原始资料,如病例、影像、检验、随访、指南、文献或实验数据,并注明必要的时间范围和上下文。数据既可来自脱敏临床或科研资料,也可整合公开数据集、开源数据库和文献,无需直接提供敏感患者信息。
重点是写清:“执行任务时实际能拿到哪些材料?”
胸部 CT DICOM、病历摘要、吸烟史与既往肿瘤史、相关检验结果、既往影像、随访记录,以及预先确定的风险分层规则。
把最终交付拆成若干个可以单独判断的结果项。每项写清预期结果、核对方式和建议权重;如允许部分得分,再设置少量、明确的评分档位。
医学结论:诊断、鉴别诊断、分型分期、风险等级、治疗或检查建议
客观结果:病灶位置、测量值、坐标、分割、检测框、统计结果或候选列表
正式交付:结构化报告、诊疗方案、标注文件、数据表、证据汇总或研究分析结果
每个结果项回答四件事:“交什么?怎样核对?占多少分?哪些情况可以得到部分分?”
应交付与核对:目标结节均被检出,假阳性数量不超过预设上限。
评分建议:按漏检和假阳性数量设置少量、清晰的评分档位,并填写建议权重。
应交付与核对:结节中心坐标位于参考病灶区域,最大径误差和分割边界误差在预设范围内。
评分建议:按测量或分割误差范围设置评分档位,并填写建议权重。
应交付与核对:风险分层与金标准或预先确定的规则一致。
评分建议:按分层结论和关键依据的完整程度评分,并填写建议权重。
应交付与核对:必填字段齐全,病例编号、影像和结论一一对应。
评分建议:按字段缺失或对应错误的程度评分,并填写建议权重。
按照实际工作经验,简要描述医生或研究人员通常会怎样查看资料、使用软件或数据库、完成测量、检索、分析和判断。关键环节可以并行、反复或包含条件分支;无需写成标准操作规程,也不要求系统按照同样顺序执行。
这一步用于帮助技术团队理解:任务包含哪些专业能力和工具,而不是规定唯一解题路径。
在阅片软件中调窗并逐层检查,定位结节并完成测量;对照既往影像判断变化;结合病历和风险因素进行分层,最后整理为结构化评估结果。
先写常见错误对应的扣分或总分上限;只有可能造成明显临床伤害、错误干预、病例错配、结果伪造或研究结论严重失真时,再设置不通过、停止执行或专业复核。
可以分别回答:“出现什么问题,影响多少分?”“只有在什么高风险情况下,需要停止、不通过或请专业人员复核?”
测量误差超过范围、假阳性过多或报告字段缺失,可按预设档位扣分;患者或病例错配、结果与影像不对应,可按事先规则严重扣分或记为不通过;关键影像缺失导致无法可靠判断时,应提示资料不足,并请求补充或专业复核。
最终只需讲清五件事:任务背景与目标、可用的输入材料、输出要求与评分建议、关键过程,以及错误对应的扣分和必要处理。医学专家定义专业内容,技术团队负责实现评测。
真实案例导读
案例展示不同信息如何共同支持专业判断,以及怎样描述合格结果和安全边界;技术文件和实现细节只在确有核查价值时出现。
CONTRIBUTOR Q&A
如果您对任务类型、问卷填写或其他内容有任何疑问或建议,欢迎填写此表单。我们将在收到反馈后尽快与您联系。
可以。您只需说明真实工作需要哪些材料、通常要完成什么、最终应交付什么结果,以及怎样判断结果是否合格。技术实现由 CALE 团队负责。
适合的任务应来自真实诊疗或医学研究。智能体可以基于一种或多种材料,完成查看、测量、检索、分析、判断或文件操作,并输出可核验的专业结果。 核心要求是:真实工作、包含真实的专业工作环节、结果能够核验。
单纯回答问题通常不够。建议还原真实工作,例如让智能体读取原始资料、完成必要分析,并提交诊断、分期、报告、标注或方案等正式结果。
不必须。可以使用脱敏临床数据、公开数据集、指南文献、实验数据或根据真实流程整理的材料。请勿提交患者姓名、证件号码、联系方式等身份信息。
可以。先说明任务要解决什么问题、需要什么材料、最终产生什么结果。CALE 团队会协助完善任务内容和核验方式。
不要求只有一个固定答案,但需提前明确合格标准。报告类结果可拆分为诊断、疾病类型、病灶位置、分期等关键内容,检查是否准确、完整;也可依据误差范围、适应证、禁忌证和安全规则评分。
不需要写成标准操作手册。只需概括医生通常查看哪些材料、使用哪些工具、完成哪些关键分析和判断,帮助团队准确理解任务。
例如诊断、分型、分期、风险等级、测量值、病灶位置、检测框、分割结果、结构化报告、治疗建议、数据表或统计结果。核验标准应尽量明确、客观,并可重复执行。
不建议直接使用。公开可检索的现成题目可能已被模型见过,存在题目泄露和评测失真的风险。可以在此基础上结合真实工作流程进行改编或二次开发,重新设计任务材料、问题设置和核验标准后再提交。
Contribute a task