我把 AI 做成
真正可用的产品。

精选项目

查看全部项目

Live Transcriber

一套完整的端侧音频机器学习工作流:从录音、导入与模型推理,到区分说话人的转写审阅、翻译、搜索和内容再利用。

  • 端侧 AI
  • 实时音频
  • 本地优先
  • 全栈产品
Act to See 交互与关节结构重建流程

主动感知 · RSS 2026 Workshop

Act to See

一个闭环机器人系统:通过与未知关节物体交互,在线重建显式 URDF,并将这一结构化表示同时用作输出和规划记忆。

查看项目
SceneFun3D 可供性定位方法概览

3D 视觉 · CVPR 2026 挑战赛冠军

OpenSUN3D 可供性定位

一个开放词汇 3D 可供性定位系统,结合 3D 分割、语言引导的候选区域和视觉语言模型验证,在三维场景中定位真正可交互的功能部件。

查看项目
交通异常检测的注意力可视化

端侧感知 · 2026

实时交通异常检测

研究图像预训练视觉 Transformer 的准确率与延迟取舍,在 DoTA 数据集上达到 78.1% AUC-ROC,并实现 200 FPS 的推理速度。

查看研究
激光雷达点云可视化与标注界面

量产感知 · 蔚来

人机协同的 4D 数据引擎

搭建被多个感知团队使用的激光雷达—相机可视化与标注系统,并训练点云时序模型,为高密度行人跟踪数据流程提供实时支持。

  • 激光雷达
  • 相机
  • 目标跟踪
  • 数据引擎
项目详情

我的工作方式

01

产品系统

我把模糊需求转化为连贯的原生工作流,并一路负责隐私、可靠性、分发和用户支持。

02

端侧 AI

我在延迟、内存、电量、离线使用和可替换运行时等真实约束下,集成语音、语言与视觉模型。

03

感知与机器人

我构建连接传感器数据与行动的工具和模型,从量产激光雷达流程到交互式 3D 场景理解。

近期成果

联系我

如果你也在打造一个
既聪明,又真正可用的系统。

聊一聊