跳到主要内容
AI 实验室

我们交付的系统背后的方法

在感知、序列建模、语言、音频与端侧优化方向上的应用研究,目的是把模型放到客户的硬件上,并让它在那里保持诚实,而不是为了发表一张图表。本页是我们真正用来构建系统的术语表。

  • 运行时C++ · CUDA · TensorRT · ONNX Runtime
  • 目标平台Jetson 级边缘设备 · 工作站 · 风冷机架
  • 工作准则每次上线前都要过留出集评测
  • 归属权重、代码与评测都留在客户手里
旗舰计划

厂内工业 AI:从芯片到答案

实验室的领衔计划是一套完全运行在客户建筑内的隐私优先诊断栈:本地模型、经验证的训练世界、确定性控制与边缘加速产品线,以测量优先的方式开发。

确定性运行时控制

研究确定性控制对小型 AI 智能体能做什么、不能做什么:有界步骤、把诚实弃答视为正确答案的封闭词表,以及需要证据佐证的断言。

本地模型推理栈

开放权重模型经量化后跑在普通硬件上,并为工业根因分析做微调,让工厂的遥测数据永远不出工厂。

带已验证真值的训练世界

一个数据引擎,把真实的故障标注风电与光伏遥测档案和基于物理的合成电站,转化为答案可核查的训练与评测世界。

边缘加速计划

一条边缘协处理器产品线,用于高吞吐向量检索与实时漂移和异常监测,设计定位是放在一台标准工业电脑旁边。

每一项能力断言在发布前都要通过阈值冻结的预注册评测;流式监测的数学已用真实量子硬件测量数据验证。一篇关于控制工作的研究论文正在撰写中:结果将先以公开预印本发表,再提交同行评审,负面发现也一并公布。

组合页中的诊断栈
计算机视觉与 3D 感知

深度、几何,以及一台相机能被信任到什么程度

这项工作是将像素转化为度量结构, 无论是通过单个镜头还是经过校准的拍摄装置, 然后决定该结构中哪些部分值得采信。

单目度量深度
由单台相机得到逐像素的稠密深度,在场景专属采集数据上微调,并对已知几何做尺度锚定,使输出是以米为单位,而不是相对量。
双目与多视图几何
针对标定装置的极线校正、semi-global matching 与基于学习代价体的双目匹配;当装置本身是一台运动相机时,则用光束法平差与 structure-from-motion。
点云处理
体素降采样、用 RANSAC 拟合地平面、欧氏聚类,以及面向 LiDAR 与深度传感器回波的稀疏卷积骨干网络,并包含与仿真场景对齐的真值校核。
鸟瞰视角融合
将摄像头特征提升到自上而下的网格中,并与距离传感器融合,从而使占用情况、空闲空间和车道级结构均源自同一表示。
不确定性与置信度校准
逐像素的置信度输出头、温度缩放与共形阈值,使下游规则可以拒绝依据模型自己都不信任的深度去动作。
序列模型与预测

时间序列、循环结构,以及取代了我们当年那批模型的新架构

传感器流、销售历史与事件日志首先都是序列。我们按数据的形态和设备的算力预算来选架构,而不是按什么正流行。

xLSTM(sLSTM / mLSTM)
带指数门控与矩阵记忆的扩展 LSTM 单元。这是一类循环模型,能以线性代价找回 Transformer 的长上下文表现;当模型要在一台边缘设备上连续跑几个月时,这一点尤其关键。
状态空间模型
面向超长传感器序列的选择性状态空间层(Mamba 系列):当注意力的平方级显存成为瓶颈、而固定时延的循环扫描才是硬性要求时,就用它。
时序卷积
面向高采样率信号的空洞因果卷积加残差块:一个稳定、可解释的基线;每次选型比拼我们都会带上它,好让更花哨的模型必须先赢过它。
概率化预测
分位数输出头、共形预测区间,以及相对季节性朴素基线的技能得分,使一份预测在交付时就带着它自身不确定性的宽度,以及一个胜过照抄上周的理由。
数据流上的异常检测
在遥测窗口上使用重构误差与密度模型,并采用按事件聚类的评测方式,使一次长时间故障只计一次,误报则按每台设备每月来统计。
自然语言与检索

让语言模型在从不出楼的文档上干活

有意思的问题不在模型本身,而在它周围的一切:会给出出处的检索、有边界的生成,以及能赶在用户之前发现漂移的评测。

检索增强生成
稠密加稀疏的混合检索(向量相似度与 BM25)配合 cross-encoder 重排序,并做好分块,使每个答案都带着它所依据的原文片段,以及一条读者可以点开的引用。
向量表示与向量索引
针对客户自有词汇表进行微调的嵌入模型,在本地硬件上使用 HNSW 或 IVF-PQ 进行索引,并以标注的查询集作为基准衡量召回率。
结构化抽取
基于类型化模式的约束解码:合同、发票和表格均被验证为有效记录,而模型的未作判断则被计为一个特征。
有边界的智能体框架
会调用工具的智能体,配有动作白名单、预算上限、每一次调用的完整轨迹,以及在做出任何有后果的动作之前的人工审批闸口。框架才是产品,模型只是其中一个部件。
评测与漂移
黄金问题集、忠实度与引用准确率打分,以及在每次更换模型或索引时都会跑的回归闸口,使一次悄无声息的退化以一条失败的检查暴露出来。
音频与信号处理

先把语音和声音当信号,再当语言

电话线上的人声和轴承上的振动是同一门学问:前端信号处理决定了模型最终能看到什么。

流式语音识别
采用分块处理、低延迟转录技术,并针对电话带宽优化了语音活动检测和结束点检测功能。该系统在本地硬件上运行,因此音频数据绝不会穿越网络边界。
说话人与事件检测
用说话人分离解决谁在什么时候说了什么,再加上声学事件分类(托盘掉落、警报响起、机器音调改变),都基于 log-mel 与 constant-Q 表示。
阶次跟踪与频谱特征
把振动信号按轴的转速重采样,使轴承与齿轮的特征落在固定阶次上;再用包络谱与峭度图找出普通 FFT 掩盖掉的故障。
自监督音频预训练
在客户自己现场采集的无标注录音上做对比学习与掩码预测预训练,使下游分类器学到的是数小时的上下文,而不是寥寥几个标注。
语音合成与对话时延
流式合成,轮次切换控制在一秒以内,从来电者说完最后一个字到第一声可听见的回应做端到端测量,并且就跑在承载这通电话的同一台硬件上。
用 C++ 做实时跟踪

以帧预算为规格的多目标跟踪

检测是容易的那一半。在固定的毫秒预算内,跨遮挡、跨相机、跨一整夜录像地保住每个目标的身份,工程量才在这里。

基于检测的跟踪
卡尔曼滤波的运动模型,配合在 IoU 与外观代价上做匈牙利匹配,采用 ByteTrack 式的低分框回收;轨迹生命周期规则按每路相机分别调,而不是一套参数走天下。
重识别与外观向量
用紧凑的向量网络在断档之间和相机之间匹配同一个目标,并对匹配置信度不足以合并的情形给出明确策略。
传感器融合
相机、LiDAR 与雷达在轨迹层做融合,共享状态并对齐时间,使某一路传感器丢掉的目标由另一路接着托住,而不是重新生成一条新轨迹。
零拷贝流水线
GStreamer 和 DeepStream 图,其中帧数据驻留于 GPU,涵盖从解码到推理再到叠加的整个流程,设计中未涉及与主机的往返通信,且已考虑了每条流的延迟。
确定性的 C++ 运行时
预分配缓冲区、无锁队列与锁页内存;用 Nsight 做性能剖析,并用带 sanitizer 的构建做检查,因为一个每小时卡一次的跟踪器算不上跟踪器。
边缘 AI 与嵌入式部署

让模型装进它必须待着的那台设备

模型训练完不算完;要在设备的散热、内存与时延包线之内无人值守地跑上很多年,才算完。

Jetson 级部署
针对每种设备和每种精度构建 TensorRT 引擎,在效益显著的情况下进行 DLA 卸载,并根据测得的热预算选择电源模式和时钟配置文件。
硬件感知的架构搜索
按目标设备上实测的时延来挑骨干网络与输入分辨率,而不是按纸面上的 FLOPs,并用真实芯片跑出来的时延查找表做支撑。
封装式一体机
只读根文件系统、签名镜像、看门狗与离线可用,让客户拥有一台在网络掉线时仍能继续干活的设备。
现场遥测与漂移监控
输入分布与置信度直方图以摘要形式回传,绝不回传原始画面,这样我们能看出某台相机的标定在漂移,却看不到这台相机拍到了什么。
安全更新
配合 A/B 分区的分批灰度发布,健康检查不通过就自动回滚。模型更新就是一次部署,也要用部署的纪律来对待。

优化工作台

我们交付的每一个模型都要过同样的五道工位。顺序很重要:没做过性能剖析就不量化;留出集评测没确认压缩后的模型仍能胜任之前,就不放它上线。

性能剖析

在真实的目标设备上、在真实的输入分布下测量逐层的时延与显存占用,同时把当时的温度状态一并记录下来。

  • Nsight
  • 逐层时延
  • 散热包线

剪枝与蒸馏

先对通道和注意力头做结构化剪枝,再把完整模型的知识蒸馏进较小的模型,这样容量是从剖析结果显示闲置的地方拿掉的。

  • 结构化剪枝
  • 知识蒸馏
  • LoRA 合并

量化

先用具代表性的校准数据做训练后量化;只有当 INT8 或 FP8 带来的精度损失是评测无法接受的时候,才上量化感知训练。

  • INT8 / FP8
  • PTQ → QAT
  • 校准集

编译

按设备与精度做图融合、算子选择与引擎构建,从 ONNX 到 TensorRT;目标平台压根没有 GPU 时,则编译成对应的运行时。

  • TensorRT
  • ONNX Runtime
  • 算子融合

验证

压缩后的模型要重新跑一遍完整的留出集评测,按事件聚类并对基准率做校正;任何一处出现退化,都把它退回上一道工位。

  • 留出集评测
  • 回归闸口
  • 签名产物

我们公开方法。数字活在你们的评测集里、你们的硬件上,你们随时可以自己重跑一遍。

实验室是怎么工作的

先有基线,再谈新意

每个实验都要带上那个无聊的基线:季节性朴素法、一个线性模型、去年的架构。只有当一个新方法在留出数据上、跨多个随机种子都赢过基线,并以均值加离散度的方式报告出来时,它才会被交付。

预先登记的评测

阈值、指标,以及怎样才算通过,都在开跑之前写下来。一个必须事后改规则才成立的结果,是关于规则的发现,不是成功。

现实太贵的地方就用合成数据

仿真场景、渲染出的传感器数据与构造出的边界样例,补上真实数据填不满的空缺,而每一个合成结果在算数之前,都要用一次真实采集来确认。

产物归客户所有

权重、训练代码、评测框架与运行轨迹,都会交付到客户自己的代码仓库和硬件上。方法留在我们这里;它产出的一切都留给你们。

实验室常被问到的问题

你们会发论文或跑公开榜单吗?

我们公开方法,客户同意时也偶尔写点东西。但我们不在这个网站上公布准确率数字:它们依赖于并不属于我们的数据,而一个脱离了评测方案的数字就是营销。

你们能在我们已有的模型和数据上开展工作吗?

通常可以。第一步是围绕你们现有的东西搭一套评测框架,一个双方都能信的基线,之后才谈该改什么。

你们面向哪些硬件?

系统必须落在哪儿,我们就面向哪儿:Jetson 级边缘设备、工作站 GPU、风冷机架,以及在完全没有 GPU 的地方用编译好的 CPU 运行时。优化工作台的存在,就是为了让同一个模型能诚实地装进其中任何一种。

最后审阅:

深色的空心金属圆柱构成的抽象图案

把问题带给实验室

描述清楚信号是什么、设备是什么,以及它要支撑的那个决策。我们会告诉你这些方法里哪些用得上、基线大概长什么样,以及我们想先测量什么。

与实验室聊聊