硬件项目介绍
面向儿童线下探索空间的智能陪伴与兴趣转化系统 让孩子的好奇被听见、被延伸,并转化为可以回看和带走的探索成果。 项目概述 好奇迹是一套面向博物馆、科技馆等儿童线下探索空间的智能陪伴系统。它以移动机器人作为现场交互载体,在家长掌握移动与授权的前提下,通过儿童化讲解、自然语音对话、视觉理解和兴趣线索识别,帮助孩子沿着自己的好奇继续探索;同时把照片、对话、路线、兴趣元素与纪念画组织成参观后的个人记录。 一句话说明:好奇迹不是替孩子规划一条标准答案路线,而是陪他沿着自己的兴趣继续走下去。 当前真实状态:移动机器人遥控与儿童语音对话已经能够实时运行;展品识别、兴趣识别、自动拍照和探索报告属于部分完成;下一展品推荐仍为后续规划,机械臂自动落笔闭环尚未证实。当前版本应表述为“核心链路可运行、完整闭环仍在集成”,不宜描述为全自动成品。 一、项目定位 1. 服务对象 以儿童为核心体验者;家长或监护人掌握移动、路线与隐私授权;场馆负责知识与内容边界。 2. 首个场景 以博物馆青铜器展览作为验证入口,原因是该场景知识密度高、成人表达明显、亲子讲解门槛高。 3. 产品形态 当前系统结构更接近B2B2C:以场馆为部署与服务入口,为家庭提供现场陪伴以及参观后的照片、报告和纪念品体验。 4. 能力边界 博物馆是验证入口,不是能力边界。后续可迁移到科技馆、自然教育基地、研学和亲子文旅空间。 二、我们要解决的问题 孩子并不缺少更多知识,而是缺少一个能及时理解“为什么这个细节吸引我”、愿意顺着兴趣继续交流的探索伙伴。家长愿意陪伴,却常常不知道孩子此刻需要听到什么程度、如何把“快看这个”变成真正有来有往的对话。场馆拥有专业内容,但统一讲解和成人表达难以根据不同孩子的语言、表情和动作即时调整。 对孩子:好奇信号容易被忽略,探索被统一路线和标准答案打断。 对家长:专业讲解门槛高,既担心讲不清,也难以捕捉孩子的真实兴趣。 对场馆:儿童服务能力不足,缺少可用于优化内容的匿名化兴趣反馈。 核心问题是补上“理解兴趣—及时回应—继续延伸—留下结果”这一段体验。 三、解决方案与系统组成 好奇迹把一次参观组织成四个连续动作:听见兴趣信号、用儿童能理解的方式回应、给出与兴趣相关的探索方向、留下可回看的记录与可带走的作品。四类端侧共同承担体验与安全责任。 1. 场馆协作中心 主要使用者为场馆工作人员,承担展品知识、儿童表达口径和内容审核的配置工作。当前Vue 3页面可以运行,但展品管理和画作建议主要为前端模拟;真实知识主要维护在配置文件中。 2. 家长端应用 主要使用者为家长或监护人,提供服务解锁、虚拟摇杆控制、授权拍照、照片查看和探索报告查看等功能。网页已经部署,但账号体系和部分主体数据仍未完成。 3. 移动陪伴机器人 主要服务孩子与家庭,在展品前进行讲解、倾听提问、视觉问答和兴趣证据采集。网页遥控和本地语音对话链路已经能够运行。 4. 绘画机械臂 目标是把兴趣元素转化为现场绘画。当前已经完成纪念画图片生成和跨服务器传输,自动转轨迹并驱动真机落笔仍待打通。 四、机器人何时开口 1. 到达展品时:提供简短、易懂的基础介绍,不一次性灌输全部信息。 2. 出现兴趣信号时:依据停留、朝向、偏好表达、连续追问、重复互动以及音量和语速等弱证据,决定是否继续交流。 3. 孩子主动提问时:从人工预设、场馆审核的资料中回答;当前不依赖实时联网搜索。 这些线索仅用于判断是否继续互动以及如何延伸,不用于对孩子做性格、能力或心理诊断。 五、目标体验闭环与现场演示 以下流程同时说明“目标体验”与“当前演示边界”。已实现的步骤可实时运行;尚未闭环的步骤明确标注为部分完成或人工触发。 1. 抵达展品 家长用手机虚拟摇杆控制机器人来到青铜鼎前,机器人进行简短的儿童化介绍。遥控与语音链路可实时运行。 2. 发现兴趣 孩子注意到兽面纹或“大眼睛”,系统结合停留、朝向、语音和连续互动记录兴趣证据。兴趣识别已有混合链路,但正式现场样本仍少。 3. 自然问答 孩子追问铸造方法,机器人通过本地多模态模型和预设展品资料回答。自由问答与摄像头画面理解可以本地运行。 4. 延伸探索 目标体验会推荐相关展品,并由家庭决定是否前往。当前“下一展品推荐”尚未实现,演示时需要使用预设路径或人工引导。 5. 记录与创作 获得授权后,系统保存代表性照片、对话片段、路线与兴趣元素。报告链路部分完成,系统可生成纪念画图片并传至机械臂侧。 6. 交付成果 目标是在出口附近由机械臂完成最后绘制,并向家长端交付发现手册。当前机械臂自动落笔仍需人工触发或进一步集成。 六、现场演示建议口径 1. 重点展示实时遥控、安全停车、儿童语音对话、视觉问答和兴趣证据记录。 2. 照片、报告与画作生成按“真实代码+预设资料+少量联调数据”的状态说明。 3. 下一展品推荐使用预设演示路径,不宣称已有实际推荐算法。 4. 机械臂部分展示图片生成与传输;如果现场落笔依赖人工触发,应在解说中明确。 七、实际技术实现 当前工程以Jetson本地推理为核心,通过云端HTTPS服务与常驻SSH隧道连接手机网页、机器人开发板和数据接口,在有限算力条件下兼顾语音、视觉、对话与运动安全。 1. 机器人与计算 机器人本体为高擎Mini Pi Plus。计算平台为NVIDIA Orin NX Developer Kit,具备16GB级内存,当前使用25W模式。系统环境为Ubuntu 20.04、JetPack 5.1.5和aarch64。视觉硬件为Intel RealSense D435i RGB-D相机。 2. 机器人控制 使用ROS Noetic和Python。真实话题包括/cmd_vel、/joy_msg、/fsm_state、电机反馈和相机压缩画面。控制网关同时检查电机反馈和FSM状态。 3. 遥控链路 控制路径为:手机网页→HTTPS云端接口→常驻SSH隧道→开发板Python网关→ROS运动话题。短时控制租约确保松手或断网后自动停车。 4. 语音链路 语音唤醒使用Sherpa-ONNX Zipformer KWS;VAD使用Silero VAD ONNX;ASR使用Qwen3-ASR-0.6B Q4_K量化模型并通过CrispASR本地服务运行;声纹门控使用3D-Speaker CAM++;TTS使用本地量化CosyVoice3。 5. 对话与视觉 使用Qwen3.5-2B-Q4_K_M.gguf和mmproj-BF16.gguf,通过llama.cpp本地部署。上下文窗口为16384 tokens,关闭思考模式,并尽量将GPU层卸载到Jetson GPU。 6. 展品知识 展品知识主要来自人工预设资料和参考图。museum_config.yaml管理展品ID、介绍词、互动问题、视觉描述和参考图。YOLO11n轻量特征索引用于候选匹配,再由本地Qwen模型复核。 7. 网页与云服务 家长端采用Next.js 16、React 19、TypeScript、Vinext/Vite和Nginx。场馆端采用Vue 3。云端使用Ubuntu、Nginx HTTPS和Python ThreadingHTTPServer。 8. 数据与记忆 开发板和云服务器均使用SQLite,保存Episode Memory、语义偏好、展品进度、照片和报告数据。 9. 兴趣画作 使用豆包Seedream图像API生成纪念画图片,并将文件传到高擎Panthera-HT六轴机械臂侧。图片到绘画轨迹及真机落笔尚未形成可核验闭环。 八、当前完成度 状态依据“能否真实运行、是否依赖预设数据、是否形成完整闭环”判断。 1. 家长端网页:部分完成 已部署;移动端适配、遥控、照片和报告增量接口可用,登录和部分主体数据仍为演示。 2. 场馆协作中心:演示模拟 页面完整可运行;儿童声纹录入是真实功能,Prompt、展品管理和画作建议主要为前端模拟。 3. 移动机器人遥控:已完成可运行 网页摇杆、云端中继、SSH隧道、ROS运动和安全停车链路均已实现。 4. 儿童语音对话:已完成可运行 KWS、VAD、ASR、视觉LLM、TTS和声纹均为真实本地模型。 5. 展品识别与讲解:部分完成 真实识别与讲解代码已经完成,但展品库样例少,尚未完成场馆级标定。 6. 兴趣识别:部分完成 真实混合算法和模型复核已经实现,但正式现场数据较少。 7. 下一展品推荐:后续规划 未发现可核验的实际推荐算法或执行接口。 8. 自动拍照:部分完成 授权门控、候选帧、兴趣复核、落盘和上传代码存在,并已用少量样本联调。 9. 探索报告生成:部分完成 Episode Memory报告生成、上传和查询接口存在;网页仍混有静态演示报告。 10. 机械臂绘画:部分完成 兴趣画作生成和图片传输已经完成;自动转轨迹并真机落笔的闭环未证实。 11. 参观到纪念品串联:部分完成 多段链路可以运行,但推荐和机械臂落笔尚未形成完整自动闭环。 对外表述原则:可以说“核心交互链路已跑通、关键模块已实现并进入闭环集成”;不应说“所有环节均已全自动运行”或“已具备成熟场馆部署能力”。 九、核心创新与参与者价值 核心创新: 1. 从统一讲解转向兴趣驱动的陪伴。当下的观察和提问决定后续交流方向。 2. 从单次问答转向连续探索。Episode Memory将多轮观察、对话和偏好串联起来。 3. 从纯数字互动转向可带走成果。照片、报告、纪念画与线下绘画目标共同构成体验闭环。 4. 从替代家长转向增强亲子陪伴。家长始终掌握移动、路线、授权和是否继续探索的决定。 参与者价值: 对孩子:有人听见并回应他的好奇;知识以更容易理解和参与的方式出现;探索留下个人化成果。 对家长:降低讲解压力,获得理解孩子兴趣的具体线索,同时保留共同探索和决策的参与感。 对场馆:在不牺牲专业性的前提下补充儿童服务能力,并获得用于优化内容的匿名化反馈线索。 十、安全、隐私与产品边界 1. 运动安全 家长端提供停止与紧急停止。控制网关以短时租约、实时电机反馈和FSM状态门控降低断网与误动作风险。 2. 监护人授权 拍照、对话片段和探索记录应在监护人授权后采集。正式产品需要补齐账号、权限、撤回和删除机制。 3. 儿童数据最小化 兴趣信号仅服务当次互动和内容延伸,不进行性格、能力或心理判断。 4. 知识边界 展品知识以人工预设和场馆审核资料为主,不把实时联网搜索作为当前能力。 5. 移动边界 当前由家长遥控,不宣称自主跟随或自主导航。 6. 生成边界 纪念画图像生成使用外部API。机械臂自动落笔仍待完成,应避免把概念图当作真机闭环证据。 十一、下一步计划与应用延展 下一阶段的优先级不是增加更多概念功能,而是把现有模块收敛成稳定、可复现、可在真实场馆验证的数据闭环。以下时间规划为工程建议,并非已经确认的对外承诺。 近期,约1个月:扩充真实展品库和参考图,完成场馆标定,清理网页演示数据,稳定兴趣照片、报告和记忆链路。 中期,约3个月:实现下一展品推荐,跑通图片到机械臂轨迹与真机绘画,开展小规模真实场馆试点。 阶段目标,约半年:完善账号、权限、隐私授权、设备运维和多场馆知识配置,形成可复制部署方案。 当“感知兴趣—儿童化回应—关联推荐—作品与记录”机制在博物馆完成验证后,可以迁移到科技馆、自然博物馆、水族馆与动物园、自然教育基地、研学活动和亲子文旅空间。不同场景需要替换知识内容、互动口径与场馆流程,但孩子视角的陪伴机制保持不变。 优先试点建议:博物馆、科技馆和研学机构与当前产品及技术形态的匹配度最高;正式合作计划仍需团队确认。 十二、开发过程与团队信息 可核验的近期开发工作包括: 1. Mini Pi Plus、Jetson、ROS与RealSense硬件链路集成。 2. 网页实时遥控、状态门控与失联安全停车。 3. 本地语音唤醒、VAD、ASR、视觉LLM、TTS与声纹门控。 4. 视觉问答、展品特征识别、主动讲解与Episode Memory。 5. 兴趣证据、自动抓拍、报告接口以及家长端、场馆端网页原型。 6. 兴趣画作生成和跨服务器文件传输。 可确认的密集集成时间为2026年8月28日至30日;公开脱敏工程基线于2026年8月30日凌晨发布。这只能证明近期集成窗口,不能代替正式立项时间。 主要工程挑战是在Jetson有限算力上并行运行视觉、语音识别、对话和语音合成,同时保证儿童交互需要的低延迟,并应对公网隧道不稳定、机器人状态误判和运动安全问题。当前采用量化模型、25W功率模式、模型常驻预热、GPU卸载、事件驱动架构、控制租约自动停车、分层健康检查和本地SQLite记忆等方式解决。 团队信息待补充:团队总人数、完整成员姓名或昵称、逐人分工、指导老师、正式合作伙伴、项目立项时间,以及现场前与现场期间的工作边界。当前唯一可公开核验的昵称为ZxShane,即GitHub仓库发布者,不能据此推断项目只有一名成员。 十三、核验口径与资料范围 本说明将原项目叙事与工程核验结果合并,遵循“真实运行状态优先、无法证实的信息不作确定陈述”的原则。核验范围包括公开项目主页及脱敏基线、展馆配置与兴趣识别代码、开发板实时状态与主要工程、云服务器服务与数据库,以及Panthera-HT机械臂工程和画作传输日志。 本文中的后续时间表、试点对象和B2B2C产品形态属于基于当前工程结构的建议或判断,仍需团队正式确认后才能作为对外承诺。 让每个探索空间,都多一个真正从孩子视角出发的入口。
团队
深度思考中......