
A | AI摘要 厦门持续夯实医疗服务体系,截至2025年末全市卫生人员近5万人,医师超2万。值此第九个中国医师节来临之际,向坚守一线、守护健康的广大医务工作者致敬。 专注AIGC技术的专业社区,关注大语言模型(LLM)的发展和应用落地,聚焦LLM及AI技术的市场研究和开发者生态,欢迎关注! 递归自我改进与自动化研究正成为 AI 领域最活跃的前沿问题。

B | Agent 们正在开放式科学发现里超过人类。 Google DeepMind 的 AlphaEvolve 把 4×4 复数矩阵乘法压到 48 次标量乘法,Together AI 用一群 Agent 把 11 维 kissing number 下界从 593 推到 604,Karpathy 的 autoresearch 给了极简自动训练研究框架。

C | 腾讯混元刚刚发布了首个 AI 科学家 Hyra(Hunyuan Research Agent,混元研究 Agent),定位是能递归自我改进的研究型 Agent。 健康是人民群众最朴素的期盼,也是城市最暖的底色。

D | 从高山村落的义诊现场到海岛渔村的送医之路,从智慧就医的便捷体验到暖心服务的细微举措,全市医务工作者深入落实厦门市卫健委“提升三服务、打造三满意”工作部署,用实干与实绩书写新时代健康厦门“民心答卷”。 它用一套极简脚手架,跑通了十多个自我改进和自动化研究场景里的真实任务。 Hyra 把智能和算力换成可验证的成果,AI for AI、AI for Science、AI for Fun 三条线都有具体产出,部分数学题和 GPU 内核优化还刷新了业内已知最好成绩。 据厦门市卫健委统计,截至2025年末,全市卫生人员总数达49195人;其中,执业(助理)医师达20642人,比2024年稳步增长。

E | 全市共有医院70家、社区卫生服务中心33家、基层医疗卫生机构2679家。 Hyra 长什么样 Hyra 的设计哲学来自 Rich Sutton 那篇经典的 The Bitter Lesson(苦涩的教训),框架尽量轻,给 Agent 留足动作空间。

F | 这些数据背后,是新时代医务工作者在坚守初心,践行“敬佑生命、救死扶伤、甘于奉献、大爱无疆”医者精神。 拿到一个任务描述,Hyra 会跑一个持续循环,从过往经验里找灵感,迭代出更好的方案。

G | 经验包括执行日志、评估器反馈、源代码、之前方案留下的工件。循环一直跑,直到 Agent 自己决定停下或者算力预算耗尽,最后交回最优解。 2026年8月19日是第九个中国医师节,海西晨报社特别策划了一组报道,致敬每一位以凡人之躯扛起生命重托的医师。 上图是 Hyra Harness 的核心循环。Context Agent 维护经验库,不断往任务队列里加新的灵感上下文。

H | 多个 Proposal Agent 从队列取灵感,写出更好的方案。 便民服务 “一站式出入院”启动 王阿姨家住镇海路附近,常年要到厦门大学附属第一医院(以下简称“厦大附一”)看病取药。

I | 每个方案以 solve.sh 为入口,在隔离沙箱里跑一遍拿到分数,再把工件交回经验库。过去,王阿姨看病免不了折腾。 具体看,Context Agent(上下文 Agent)维护一个 Experience Bank(经验库,简称 EB),记录所有方案和评估结果,再把 EB 里的素材合成为 Inspiration(灵感)丢进任务队列。早上8点,医院门诊大厅便已人山人海,大家排着队缓慢向前挪动。

J | 对王阿姨来说,可能排队较长时间,只为进入诊室和医生交流短短几分钟。每个灵感是一坨上下文,可能含代码、文件、工件、日志,把探索过程里学到的东西打包传递下去。 多个 Proposal Agent(提案 Agent)从任务队列拿灵感,反思后写出一个新方案,落到 solution/ 目录里,入口是 solve.sh。有一次,轮到王阿姨看病时,她发现自己忘了带医保卡,不得不赶回家拿卡。

K | 看完病,她早已身心疲惫。 现在不一样了。

L | 2025年,厦大附一在省内率先部署刷脸“一码付”医保结算服务,真正实现“刷脸就医”,王阿姨再也不用担心忘带医保卡,没办法看病了。

M | 方案在隔离沙箱里跑一遍,拿到分数,再把结果送回 EB。 今年7月,厦大附一还全面启动“一站式出入院”服务,每个病区都部署了“一站式出入院自助机”,患者在病区护士站或自助机上就能办理入院、出院手续,真正实现患者“入院、出院不出病区,手续床边办结”。 整个系统是异步的生产者-消费者管线。 病人优先 升级便民停车服务 除夕夜,万家团圆之际,市民冬冬却经历了一场虚惊——孩子不慎被异物卡喉,他紧急驱车到厦门大学附属中山医院(以下简称“厦大中山”)急诊就医。“几分钟,异物取出来了,然后,我开车出医院,前后不到30分钟。

N | Context Agent 持续填灵感,提案 Agent 消费队列,方案在沙箱跑评估后回传 EB。

o | 医院里停车,半小时内免费,这次就医体验太好了!”冬冬说。 “让来看病的患者少走路”,厦大中山800个停车位开放,缓解患者看病“停车难”。将最宝贵的空间腾挪给患者——厦大中山停车服务的变化是医院秉持“病人优先”理念,暖心服务持续优化升级的一个缩影。信号量控制并发,让方案质量随时间稳定提升。

p | 停车服务的变化,看似是服务患者的一小步,实则是城市文明与医疗格局进化的一大步。 如今,患者到厦大中山就诊,不论是高温天还是暴雨天,开车直接进地下停车场,乘电梯上楼就是诊室,患者的就诊越来越便利。

q | 质效提升 争分夺秒抢救生命 患者突发急性心梗,从进医院大门到血管被疏通需要多久?国际标准是90分钟内,而厦门大学附属心血管病医院(以下简称“厦心”)的答案是:37.43分钟。 任务连评估器都没有时,Hyra 会升级成双层循环。 36岁的吴先生在家中洗澡时晕厥倒地,被诊断患急性重症肺栓塞,厦心团队携带ECMO紧急驰援,仅用15分钟就成功抽吸出血栓,让患者转危为安;出现终末期心衰,又无法接受心脏移植的蔡先生,在厦心成功植入全球最轻全磁悬浮人工心脏,生命“重启”;83岁的马来西亚华侨李先生在厦心接受微创手术,解决主动脉瓣重度狭窄问题,术后第三天便能出院……厦心持续发挥国家临床重点专科与国家心血管病区域医疗中心的双重优势,进一步精进心血管急危重症精准救治技术,构建优质高效的救治网络,守护厦门及周边地区百姓“心”健康。先从任务描述生成一个初始评估器,内层循环拿它反复改进方案。 智慧共享 “互联网+中医”推广 72岁的集美居民林大伯患慢性肝病,经常需复诊调方。 内层结束后,Hyra 用 EB 里攒下的经验去改评估器,让评估代码更高效,降低 reward hacking(奖励作弊)风险,加上更细颗粒度的反馈。以前,他去药店买药,时常买不全,需要坐1小时的车到厦门市中医院取药。下一轮用升级后的评估器重开。 举个具体例子。任务是设计一个世界冠军级别的国际象棋 AI,初始评估器可能用随机生成的对手群搞 Elo 评级。“现在方便了,在社区卫生服务中心开方,下午中药就送到家,药全、质量又好。循环跑下去,那些随机对手会被 EB 里记录的更强 AI 替掉,评估器和方案一起往上进化。

r | ”林大伯说。 AI 训 AI,跑赢同行 基础模型研发本身有大量可执行、可评估、可迭代的研究环,是 Research Agent 最天然的应用场景。

s | 训练配方、数据策略、训练和推理系统、底层 kernel、评估框架,都需要研究员提假设、写代码、跑实验、看反馈再改。 “基层开方、云端流转、中医院响应”,这是市中医院牵头建设的厦门市全域智慧共享中药房为市民带来的便利。

t | Research Agent 能把每次成功和失败都变成可复用经验,迭代速度远超人工。 Hyra 在 Recursive 公开的三个任务上做了对比测试,NanoChat Autoresearch、NanoGPT Speedrun、SOL-ExecBench,分别对应固定预算训练、训练加速、GPU kernel 优化。

u | 居民通过手机即可复诊开方、预约检查,中药配送到家,医保实时结算。 不仅如此,厦门市中医院打造的“互联网+中医”服务体系,还成功入选国家发改委全国改革试点典型经验,面向全国推广。沿用 Recursive 的任务定义、评估协议和初始方案,公平较量。 截至今年7月,智慧共享中药房已覆盖厦门6个行政区的47家基层卫生机构及多家专科医院,中药代煎配送24小时内送达,厦门地区最快6小时送药到家。 三个任务都跑赢 Recursive。注意几个任务已经被研究社区反复打磨过,基线本身已经很强。 闽台协作 台湾名医“登鹭”坐诊 台胞陈先生在厦门常住,曾经他最怕突发不适时的两岸奔波——台湾健保卡在厦无法直接刷卡结算,回台湾办理,一趟流程往往耗去半个月。如今,在厦门长庚医院(以下简称“厦门长庚”)看病,他已经可以免于奔波。 作为大陆首家台资三甲医院,厦门长庚把闽台医疗协作融入每一处细节:门诊大厅的“台胞医保服务站”像一座“跨海桥”——专线一拨即通、专属窗口一窗通办,门急诊及住院5日内费用,服务站可协助办理材料确认、代寄至台湾健保机构,报销款直接打回患者个人账户。 NanoChat 上,Hyra 要在固定预算里平衡模型架构、优化器设计、学习率策略、数据流和执行效率,最后把 Validation BPB 压到 0.9015。更贴心的是,该院全国首创的“医保+公证”院内直办服务:患者住院超5天,需公证的材料,过去患者要跑公证处,如今在站内线上提交,约10分钟就能办结,公证书直抵患者手中,副本同步传至海基会,返台核退一路“绿灯”。

v | NanoGPT Speedrun 是社区精修过的加速榜,提升空间很小,Hyra 把达到 3.28 验证损失的时间从 77.5 秒压到 76.4 秒。 SOL-ExecBench 上,Hyra 联合优化 235 个 GPU kernel 的真实负载,Mean SOL 做到 0.771。 两岸(台湾)医疗转接中心设在一楼大厅,专线优先挂号;每月60余位台湾长庚名医“登鹭”坐诊,母胎医学、睡眠医学等特色专科无缝对接。 三个任务覆盖训练算法、训练系统、底层 kernel,同一套研究环能跨不同反馈环境继续产出可执行、可验证的改进。 搜索越强,评估器越早被钻空子。

w | NanoChat 里有个方案把因果语言模型改成接近双向注意力的结构,让未来 token 提前泄露,BPB 假性变低。SOL-ExecBench 里有个方案在正确性检查时缓存输出,在计时阶段跑空 kernel,分数好看但没真正解题。 光优化最终分数不够,评估本身必须进研究环。最令人振奋的是,两岸肝胆外科双院士协作——董家鸿院士与陈肇隆院士团队已携手完成3例高难度肝胆手术,为患者筑牢生命防线。方案搜索越强,评估器和验证管线得跟着进化,才能把真进步和 reward hacking 区分开。(海西晨报记者 曾昊然 于婧媛 马 丽 黄伊娜) 【相关链接】 践行医者使命,守护健康厦门,这是厦门全体医师共同的心声。

x | AI for AI 还有一个隐性闭环。本月初,复旦中山厦门医院与厦门医学院附属第二医院签署分级诊疗合作备忘录,探索城市型分级诊疗厦门模式;厦门市苏颂医院持续打造“南北同颂,医心向党”党建品牌,与同安区12个社区、11家社区卫生服务中心及数十家企事业单位签订共建协议,构建覆盖社区、企业、学校的健康服务网络;厦门市儿童医院今年增设八大疑难罕见病远程多学科(MDT)门诊……“以患者为中心”,不仅仅在于医疗器械更新迭代、医疗技术提升,更在于各家医院始终坚持“病人优先”,在细微之处久久为功。强 Research Agent 加速模型、训练系统、基础设施的研发,更扎实的 AI 系统反过来又把下一代 Research Agent 推得更强。 科学难题上的新答案 数学这块,Hyra 收集了 55 个开放数学问题,来自 EinsteinArena 和 Erich's Packing Center 等来源,很多几十年没动过。

y | Hyra 在其中 29 个上拿到了新的最优已知结果。 它还会从实验数据里挖规律。给它 1749 到 1932 年的月度太阳黑子数据,Hyra 找到了一个能预测黑子数的递推关系,在 1932 到 2026 年近一个世纪的样本外数据上 R² 达到 0.77。 同样思路可以分析 AI 模型训练日志,挖出 scaling law(缩放定律),反过来指导训练配方设计。 除了挖规律,Hyra 还能直接设计科学和工程工件。三个代表性例子。 第一个是超小 Transformer。

z | Hyra 设计了一个只有 15 个可训练参数的 Transformer,能做两个 10 位数相加。比 AdderBoard 上 36 个参数的公开纪录少 58.3%。Hyra 能在严格资源约束下联合搜索模型架构和计算机制,对研究神经网络极限和模型压缩有参考价值。 第二个是量子计算里的 qubit routing(量子比特路由)。

| 逻辑量子比特要映射到物理芯片上有限的耦合拓扑,非相邻比特之间的操作通常需要插入 SWAP 门,带来双比特门开销和噪声。

| Hyra 设计的路由算法在 IBM Q20 上比经典 SABRE 方法提升 44.4%。同一个 24-CX 路由窗口里,SABRE 插了 15 个 SWAP,Hyra 一个没用,把 CX 等价双比特门从 69 个压到 24 个,降幅 65.2%。双比特门少,执行时间短,累积误差也小。

| 第三个是药物设计。

| PARP1 是 DNA 损伤修复里的关键酶,和同源重组修复缺陷的肿瘤细胞有合成致死效应,是精准肿瘤学里的热门靶点。Hyra 拿到 PARP1 结合口袋,生成有稳定结合的类药候选分子。从布洛芬出发,Hyra 设计出一个得分 -10.60 的分子,超过了已上市 PARP 抑制剂 olaparib(奥拉帕利)的 -9.77,综合了对接打分和类药性。 还能玩出点花来 除了搞模型和搞科学,Hyra 在游戏、设计、内容创作等开放域也能玩。这类任务通常没有唯一正确答案,靠自对弈、自评估、用户反馈不断打磨策略和工件。 第一个是黑白棋(Othello)机器人。Hyra 通过自对弈不断改进。评估器搞双循环赛,新候选方案和 EB 里高分机器人对战,按 Elo 保留前 k 名,对手池越来越强。策略从 minimax 搜索进化成 AlphaZero 风格 PUCT 加 MCTS 的混合打法。最终机器人在 Botzone 平台 730 个参赛作品里排第三,对手大多是北大计算机系学生。 第二个是从单张 2D 参考图生成 3D 结构。

| VLM(视觉语言模型)当评委,按剪影、比例、结构完整性、材质、视觉相似度打分。Hyra 反复修改建模代码和渲染参数,多轮探索后产出的模型比 Claude Code 的 Goal 模式更接近参考图,也更符合人类审美偏好。 第三个是给一段旋律做多乐器编曲。内层循环用规则评估器检查和声、和弦进行、节奏密度、音区冲突等指标。外层循环根据用户反馈调整评估器,慢慢学到那些很难事先形式化的偏好。7 轮迭代下来,同一段旋律从保守的、像赞美诗一样的四声部编配,长成有减和弦、六和弦、灵活节奏和丰富配器的多乐器版本。

| 反馈来自对手、视觉模型或真实用户时,Hyra 也能把模糊目标转成可迭代搜索的过程。评估标准跟不上的时候,求解器和评估器在双层循环里一起进化。

| Hyra 团队自己也说,目前这些 demo 还只是初步成果。下一步要做的是定义更有价值、有持续改进空间的任务。除了公开榜单,腾讯的产品系统、真实 AI 研发流水线、科学和工业场景,都可以变成可执行、可验证、有清晰反馈的问题。这样能跑起来 scaffold–data–model 三者的循环进化。 更好的脚手架催生更强的模型,更强的模型反过来又把脚手架和发现推到新高度。未来几代 Hy 模型甚至一些腾讯产品,都会和 Hyra 一起协同进化。 参考资料: https://hy.tencent.com/research/hyra。
Current article:http://www.rangzhuanhoujuedu.cyou/76u9cu/td9.html
Published on:00:31:56