Zum Inhalt springen
COMPUTER VISION ENGINEERING

Einen Gastraum lesen, ohne ein Gesicht zu erkennen

Kameras hängen in Restaurants längst, und fast alle Aufnahmen werden erst angesehen, wenn etwas schiefgegangen ist. Wir haben ein Vision System gebaut, das dieselben Feeds während der laufenden Schicht liest und dem Service meldet, worauf er reagieren kann. Ein Gesichtsmodell kommt darin nirgends vor.

  • BrancheGastgewerbe und Gastronomie
  • ZusammenarbeitVision System und Operations Backend, vollständig im eigenen Haus entworfen und gebaut
  • StatusLauffähiger Aufbau; die Paketierung für die Installation vor Ort steht noch aus
  • Computer Vision
  • Privacy by Design
  • Zustandsmaschinen
  • Skelettgeometrie

Die Technik steckt in dem, was das System nicht tut

Das System nimmt die gewöhnlichen Kamerafeeds aus dem Raum, den ein Betrieb ohnehin überwacht, schwärzt alles außerhalb des vom Betreiber gezeichneten Gastbereichs und lässt die Erkennung nur auf dem Rest laufen. Heraus kommen die drei Dinge, mit denen eine Serviceleitung wirklich etwas anfangen kann: welche Tische besetzt sind, welche frei sind, aber noch Teller und Gläser tragen, und welche zu lange ohne Servicebesuch stehen.

Erzählenswert sind die Einschränkungen. Das System erkennt Personal an der Dienstkleidung statt am Gesicht. Es schickt der Betriebsseite strukturierte Ereignisse statt Bilder. Es kippt einen Tisch nicht wegen eines einzelnen Bildes in einen anderen Zustand, und es gibt keine Empfehlung ab, bevor genug eigene Verkaufshistorie des Betriebs vorliegt. Jede dieser Entscheidungen war der aufwendigere Weg, und zusammen sind sie der Grund, warum sich das System den Menschen erklären lässt, die es beobachtet.

Ein Planungsdashboard aus dem System: erwartete Umsätze für jeden Tag der kommenden Woche, Bedarfsmengen je Produkt, ein Personalniveau je Tag und der Verlauf eines typischen Geschäftstages.
Die Managementseite des Systems. Was die Kameras beitragen, kommt hier als Zahlen auf einem Bildschirm an, nie als Videomaterial.
DIE HERAUSFORDERUNG

Was ein Gastraum einem Vision System abverlangt

Das Schwierige an dieser Aufgabe sind nicht die Erkennungen. Es sind die Grenzen, die ein Raum voller Gäste der Lösung setzt.

Kameras, die nur zurückblicken

Die Kameras eines Betriebs zeichnen durchgehend auf, und angesehen wird das Material nach einer Beschwerde. Solange sich der Anlass der späteren Beschwerde noch beheben ließe, erfährt im Service niemand davon.

Die Abkürzung, die niemand nehmen sollte

Am schnellsten unterscheidet man Servicekraft und Gast über Gesichtserkennung. In einem Gastraum ist das der falsche Tausch: Er steckt alle Anwesenden in ein biometrisches System, im Gegenzug für eine betriebliche Bequemlichkeit, und er lässt sich weder den Gästen noch dem Personal erklären.

Eine Erkennung ist noch kein Zustand

Läuft ein Detektor Bild für Bild, liest sich derselbe Tisch innerhalb einer Minute als besetzt, frei und wieder besetzt, nur weil Menschen daran vorbeigehen. Ein Saalplan, der sich im Sekundentakt ändert, trägt keine Information, und nach der ersten Schicht schaut niemand mehr hin.

DIE LÖSUNG

Vier Entscheidungen, auf denen der Rest aufbaut

Jede tauscht eine auffälligere Behauptung gegen eine, die ein Betrieb selbst überprüfen kann.

Identität aus der Dienstkleidung, nicht aus dem Gesicht

Personal wird von Gästen durch ein Erkennungsmodell unterschieden, das wir selbst auf genau eine Sache trainiert haben: die Schürze. Die Dienstkleidung wird der Person über die Überlappung zugeordnet, und die Einordnung überlebt einige Sekunden, in denen die Schürze hinter einem Stuhl oder einem anderen Körper verschwindet. Es gibt im ganzen System keine Gesichtserkennung, keine Gesichtsidentifikation und kein Modell zur Wiedererkennung von Personen.

  • An keiner Stelle der Verarbeitung ein Gesichtsmodell
  • Personal wird an der Dienstkleidung erkannt, nicht an der Person darin
  • Alles außerhalb des gezeichneten Gastbereichs wird vor der Analyse geschwärzt

Eine Tischzustandsmaschine mit Hysterese

Belegung ist keine Messung pro Einzelbild. Jeder Tisch führt eine Zustandsmaschine mit getrennten Schwellen für das Besetzen und das Freiwerden, sodass es anhaltende Belege braucht, um einen Tisch als besetzt zu führen, und noch mehr, um ihn wieder freizugeben. Darüber liegt die Unterscheidung, die aus der Ausgabe eine Arbeitsliste macht: Ein verlassener Tisch mit Tellern und Gläsern darauf ist nicht sauber, und er sagt das, bis abgeräumt ist.

  • Getrennte Bestätigungsschwellen für Besetzen und Freiwerden
  • Frei und frei, aber nicht abgeräumt sind verschiedene Zustände
  • Ein besetzter Tisch ohne Servicebesuch im vorgegebenen Zeitfenster löst eine eskalierende Meldung aus

Menschen werden als Geometrie gelesen

Ob jemand sitzt oder steht, entscheidet Körpergeometrie statt eines gelernten Etiketts: Neigung der Wirbelsäule gegen die Senkrechte, Ausrichtung von Rumpf und Beinen, Hüftwinkel und Kniewinkel, für jede Körperseite getrennt abgestimmt und über die letzten Bilder geglättet, mit einem Rückfallweg, wenn die Schlüsselpunkte fehlen. Die Zuordnung zum Tisch ist auf den sitzenden Fall abgestimmt, in dem eine stehend hohe Box schlecht mit einem Tisch überlappt.

  • Haltung aus Gelenkwinkeln, je Körperseite abgestimmt und über die Zeit geglättet
  • Sitzende Gäste werden über den unteren Teil des Körpers einem Tisch zugeordnet
  • Jede Schwelle ist eine Einstellung je Betrieb und keine Konstante im Code

Daten nach außen, Namen nur mit Freigabe

Von der Vision Seite zur Betriebsseite geht ein kleines strukturiertes Ereignis: der Zustand eines Tisches, ein Servicebesuch und seine Dauer, die Aufforderung zur Neukalibrierung, nachdem der Raum umgestellt wurde. Bilder werden dekodiert, ausgewertet und verworfen. Der Vision Kern erzeugt nur eine anonyme, kameraeigene Nummer, und ein Name kommt allein über die Personalliste des Betriebs dazu.

  • Über die Leitung gehen Tischzustände und Besuchsdauern, keine Bilder
  • Die Verbindung von verfolgter Person zu benannter Beschäftigung wird vorgeschlagen und dann von einem Menschen freigegeben
  • Wurde der Raum umgestellt, meldet das System das, statt gegen einen veralteten Plan zu berichten
DIE WIRKUNG

Was die Einschränkungen eingebracht haben

Auf dieser Seite steht keine einzige Kennzahl. Nichts davon wurde gegen eine veröffentlichte Ausgangsmessung geprüft, deshalb steht hier in Worten, was das System tut.

Ereignisse statt Bilder

Was die Vision Seite sendet

Die Architektur hält das Videomaterial auf der Hardware des Betriebs: Die Vision Seite überträgt Tischzustände, Besuchsdauern und Aufforderungen zur Neukalibrierung. Ausnahmen sind die Betreiberschritte, die ein Bild brauchen, etwa das Einzeichnen der Tischgrenzen auf einem Standbild. Sie laufen nicht dauerhaft, sondern werden bewusst zugeschaltet.

Keine Gesichter

Wie Menschen unterschieden werden

Personal wird über die Dienstkleidung erkannt, Gäste werden überhaupt nicht identifiziert. Es gibt keine Gesichtserkennung, keine Gesichtsidentifikation und kein Wiedererkennungsmodell im System, das ist also eine Eigenschaft der Architektur und keine Richtlinie, die man darüberlegt.

Sagt, wenn es nicht kann

Empfehlungen

Die Empfehlungsseite ist nachvollziehbare Statistik über Warenkorbregeln, und sie trainiert und prognostiziert erst, wenn genug eigene Verkaufshistorie des Betriebs vorliegt. Bis dahin meldet sie ihren Fortschritt, statt eine selbstbewusste Schätzung zurückzugeben.

Zuletzt überprüft:

Blicken Ihre Kameras nur zurück?

Wenn Sie ein Vision System für einen Betrieb mit Menschen darin erwägen, sind die Einschränkungen der interessante Teil des Gesprächs. Erzählen Sie uns von dem Raum und davon, was gemeldet werden soll.

Projekt besprechen