Líder mundial no desenvolvimento de software VMS inteligente e PSIM
Onde comprar
Contate-nos

Modelo de Visão e Linguagem (VLM) para Detecção e Pesquisa Semântica em Vídeo

E se o seu sistema de gerenciamento de vídeo pudesse reconhecer instantaneamente cenas complexas apenas descrevendo-as em linguagem natural? Com o Vision-Language Model (VLM) do Axxon One, os usuários podem configurar a detecção em tempo real de objetos e eventos utilizando consultas intuitivas em linguagem natural.

O VLM no Axxon One também oferece suporte à pesquisa retrospectiva. Quando esse recurso é ativado, o sistema armazena descrições dos frames geradas pela rede neural durante a gravação de vídeo e as disponibiliza para pesquisas posteriores. Isso permite que os usuários trabalhem com detecção ao vivo e pesquisa em arquivos dentro de um único fluxo de trabalho baseado em IA.

Detecção Semântica em Tempo Real com VLM

Basta descrever o que você deseja detectar — seja “uma pessoa correndo” ou “uma mulher usando um vestido preto”. O Meta-Detector VLM baseado em IA processa a consulta e identifica cenas correspondentes conforme aparecem no fluxo de vídeo, oferecendo detecção de cenas precisa e integrada. No modo de pesquisa, o usuário insere uma consulta de texto, e o sistema a converte em uma representação de metadados utilizada pela rede neural para encontrar as correspondências mais próximas.

Real-time scene recognition

Reconhecimento de cenas em tempo real

Detecte objetos e eventos específicos conforme acontecem e receba alarmes quando uma consulta de texto corresponder à descrição da cena no vídeo ao vivo.

Flexible query structure

Estrutura flexível de consultas

Combine objetos, atributos (tamanho, cor, etc.), ambiente e posicionamento para uma detecção precisa.

No additional training required

Não é necessário treinamento adicional

A rede neural compreende diversos cenários de forma nativa, permitindo que os usuários trabalhem tanto com alertas em tempo real quanto com pesquisas retrospectivas sem a necessidade de criar modelos personalizados para cada tarefa.

O VLM Conecta a Intenção Humana à Execução Automatizada

Em vez de configurar regras complexas, basta descrever o que você precisa, e o sistema faz o restante. Isso torna a análise de vídeo mais acessível, flexível e fácil de adaptar às mudanças nas necessidades operacionais.

No modo ao vivo, o Meta-Detector VLM funciona como uma ferramenta online: o usuário insere uma consulta em texto e recebe um alerta quando essa consulta corresponde à descrição do quadro em tempo real.

Para pesquisas retroativas, os usuários podem habilitar o armazenamento de metadados no Meta-Detector. Dessa forma, as descrições dos quadros ficam disponíveis para pesquisas no arquivo posteriormente, sem a necessidade de configurar detectores previamente. A pesquisa é realizada em todos os metadados registrados e gerados pela rede neural durante a gravação do vídeo.

Exemplos de Detecção

  • Detectar "um pacote deixado na entrada".
  • Identificar "uma pessoa escalando uma cerca próxima à doca de carga".
  • Reconhecer "um carro branco em uma faixa de pedestres, visto de cima".
  • Pesquisar nas gravações arquivadas por "pessoa vestindo roupa rosa".

Meta-Search em Vídeos Gravados

Após habilitar o armazenamento de metadados, os usuários podem abrir a guia de pesquisa, selecionar o Meta-Search VLM e utilizá-lo da mesma forma intuitiva que as configurações do detector. Basta inserir uma consulta em texto, e o sistema retorna quadros e trechos de vídeo cujos metadados armazenados correspondem com maior precisão à solicitação.

Os usuários também podem definir o percentual de similaridade para refinar os resultados da pesquisa. Isso permite ampliar ou restringir a correspondência de acordo com o nível de especificidade da consulta e a quantidade de resultados relevantes desejada.

O Meta-Search não gera eventos por conta própria. Sua função é utilizar metadados previamente armazenados para pesquisas retrospectivas. Caso detectores específicos já estejam configurados e gerando eventos em tempo real, a pesquisa poderá ser realizada por meio desses eventos.

O Valor do VLM no Axxon One VMS

Os recursos de Vision-Language Model (VLM) baseados em IA transformam sistemas tradicionais de vigilância em plataformas de gerenciamento de vídeo mais inteligentes, flexíveis e eficientes. Ao combinar o Meta-Detector VLM para detecção semântica em tempo real com o Meta-Search VLM para pesquisas em arquivos, o Axxon One oferece:

  • Compreensão de cenas em tempo real para transmissões de vídeo ao vivo.
  • Resposta mais rápida a ameaças de segurança.
  • Maior precisão na identificação de cenas complexas.
  • Redução do tempo dedicado à revisão manual e à configuração do sistema.

Ao permitir que os usuários interajam com vídeos ao vivo e gravados por meio de descrições em linguagem natural, o Axxon One VLM oferece uma abordagem eficiente para compreensão de cenas em tempo real e pesquisas em arquivos com tecnologia de IA. Isso amplia os recursos de análise de vídeo, evoluindo da simples detecção de eventos para a compreensão semântica do conteúdo de vídeo dentro de um fluxo completo de trabalho do VMS.

Especificações Técnicas

Explore em detalhes as especificações técnicas completas do software VMS Axxon One, incluindo suas principais funções, recursos de análise de vídeo com IA e compatibilidade com diversos dispositivos e padrões do mercado de segurança.

Ver especificações
Apresentação

Baixe o PDF com a apresentação completa do Axxon One e obtenha uma visão aprofundada sobre esse avançado software de gerenciamento de vídeo, ideal para projetos corporativos de todos os tamanhos.

Download .pdf

Folheto

Tenha uma visão geral rápida sobre as funcionalidades e tecnologias que fazem do Axxon One uma referência em softwares de videomonitoramento inteligente.

Download .pdf