監視カメラは、膨大なデータを生成します。圧縮技術がなければ、保存・転送すべきビデオデータは、瞬く間に管理不能なものとなります。圧縮技術は、必要な詳細度と調査能力を維持したまま、ストレージや帯域幅の要件を削減します。
圧縮技術を導入することで、数十台、あるいは数百台ものカメラを24時間365日稼働させることが、完全に可能となります。しかし、規模の拡大には、それ特有の課題が伴います。たとえ圧縮された映像であっても、大規模な導入が進めばその量は膨大になります。カメラの台数が増え、保存期間が延びるごとに、ストレージコストは増大していきます。圧縮効率が高ければ高いほど、システムの運用期間全体におけるランニングコストは低減します。
初期の監視システムは、各フレームを個別に圧縮していました。その結果、ビットレートが高くなり、ストレージコストも増大してしまいました。その転換点は、単に各フレームを圧縮するのではなく、フレーム間の変化に着目したビデオコーデックの登場によってもたらされました。差分のみをエンコードする手法によって、ビットレートは劇的に低下し、高解像度カメラの広範な導入が可能になりました。
さらに大きな転換点は、新しいコーデックの登場ではなく、エンコーディングそのものに知能を適用したことにありました。すべてのフレームのあらゆる部分を均一に圧縮するのではなく、スマートなエンコーディングは、シーンの内容をリアルタイムで分析します。重要な領域にはより多くの帯域を割り当て、動きのない背景にはより少ない帯域を割り当てるのです。
ビデオは、カメラからスクリーンへ一気に流れるわけではありません。カメラが生の映像データを捉え、それをエンコードし、ネットワーク経由で送り、ストレージや視聴用デバイスへと届けます。圧縮はエンコーディング段階で行われます。これはカメラ内部で行われます。このチェーンの中で、圧縮されていない生の映像が存在するのは、この工程だけです。だからこそ、ここを正しく設計することが何よりも重要になります。
この作業を行うコンポーネントは、コーデックと呼ばれ、これは、コーダーとデコーダーを組み合わせた言葉の略称です。これは、一組のアルゴリズムが連携して動作する仕組みになっています: 一方はカメラで映像を圧縮し、もう一方は受信側でそれを復元します。異なる規格のコーデック同士は互換性がありません。例えば、H.264で圧縮された映像を、H.265のデコーダーで再生することはできません。だからこそ、最近のカメラでは、複数のコーデックに対応していることがよくあります。
より高度なコーデックには、より多くの計算能力が必要となります。その結果、キャプチャから表示までの間に、わずかな遅延が生じることになります。監視カメラの一般的な用途においては、この遅延はほとんど気にならない程度です。PTZ操作のように、ライブでのインタラクションを伴うアプリケーションでは、一般的に遅延に対してより敏感になります。
ビデオフレーム内のすべてのデータが、等しく価値を持っているわけではありません。静止した壁や、変化のない道路の映像を、継続的に再エンコードする必要はありません。圧縮は、重要な部分を保持しながら、その冗長性を特定して削除します: 動き、顔、ナンバープレート、イベント。
圧縮は2つのレベルで機能します:
人間の目では認識できないディテールは削除されます。フレームは同じように見えます。ファイルサイズは、ごく一部まで削減されます。
変化したピクセルのみが、エンコードされます。それ以外の部分は変化しないため、再び送信する必要はありません。一般的な監視カメラの映像では、フレーム間で画像の内容の大部分が変わりません。そのため、保存・送信すべきデータ量を大幅に削減できます。
監視ビデオ圧縮は、その設計上、非可逆です。すべてのデータを完全に保持する可逆圧縮とは異なり、非可逆圧縮では、映像の有用性に影響を与えないと判断される情報を削ぎ落とします。別の手法では、連続録画やデータ転送を行うにはファイルサイズが大きすぎることになります。
可逆圧縮は主に文書データの保存に使用されます。映画制作やデジタルアーカイブのように、細部を保持することがストレージや帯域幅の制約よりも重要視される場合を除き、 ビデオアプリケーションで使われることは通常ありません。可逆的なビットレート削減では、容量が少なすぎます。その結果、ビットレートはネットワークやストレージのインフラが許容できる範囲を大幅に超えてしまいます。
選択するコーデックが、その後のすべてを決定します: 帯域幅の要件、ストレージコスト、ビデオ管理ソフトウェアプラットフォームおよびクライアントデバイスとの互換性、そしてAI分析のために利用可能なデータの品質。注目すべき3つの規格があります。
Advanced Video Coding (AVC)
H.264は、20年以上にわたりネットワークビデオの基幹を支えてきました。信頼性が高く、互換性にも優れ、市場にあるほぼすべてのVMSプラットフォームやクライアント端末で使用可能です。
その制限は帯域幅です。高解像度で鮮明な映像を維持するには高いビットレートが必要ですが、カメラの台数が増えるにつれて、そのデータ量は膨大なものになります。また、H.264は8Kを超える動画には対応していませんが、カメラの解像度が上昇している現在、この制約がますます重要になっています。
20年以上の使用実績
High Efficiency Video Coding (HEVC)
H.265は、H.264と同等の画質を維持しながら、ビットレートを15〜40%削減できるため、性能が向上しています。常に課題となっていたのは、ライセンス料のことです。制約の多い特許条項により、ブラウザベンダーがネイティブデコーダーを組み込むことは事実上不可能となり、多くのユーザーが手動でインストールせざるを得ない状況でした。
これらの互換性の問題は、今なお解決していません。クライアントの互換性を考慮する必要がない環境においては、H.265を使用することで、実質的な効率化を実現できます。しかしながら、新規の導入においては、より強力な選択肢が現在利用可能です。
ブラウザのサポート限定
Alliance for Open Media (AOM)
AV1は、Google、Amazon、Microsoft、Netflixなどが参加する連合体である Alliance for Open Mediaによって開発され、2018年にロイヤリティフリーのオープンソースコーデックとしてリリースされました。現代のビデオストリーミング向けに設計されたこの技術は、従来の規格よりも大幅に優れた圧縮効率を実現しています。また、ビデオストリームにメタデータを直接埋め込む、表示/非表示の切り替えが可能なオーバーレイ機能などもサポートしています。
H.264と比較して、AV1は同等の画質を維持しながら、ビットレートを約40%削減できます。また、最新のブラウザやOS、モバイルプラットフォームでも幅広くサポートされているため、導入が容易であり、ライセンスに関する懸念も軽減されます。
監視カメラの分野においては、これがストレージコストの削減と、ネットワーク負荷の軽減につながります。画質の詳細が維持されることで、AI分析もより精度の高い視覚データを用いて実行できるようになります。AV1に対応したカメラは、H.264やH.265と併用することもできるため、移行作業も容易に管理できます。
新規導入に推奨
コンテンツ認識エンコーディングは、AIを用いてシーン内の重要な情報が含まれる箇所を特定します。これにより、重要な箇所にはより多くのビットレートを割り当て、動きのない背景などはより強力に圧縮することができます。その結果、重要なディテールを損なうことなく、帯域幅の消費量を抑えることができます。
分析において画質は重要です。物体検知やナンバープレート認識は、通常カメラ側で行われます。これは、圧縮前のオリジナル画像の方が、エンコードされたストリームよりも多くの情報を含んでいるためです。
生成AIは、根本的に異なるアプローチを採用しています。元の画像をエンコードするのではなく、再生中にビデオの一部を再構築します。その手法は、エンターテインメント向けのストリーミングであれば、許容できるかもしれません。監視カメラの映像は、捜査や証拠としての使用が求められることが多く、そのため精度に対しても異なる基準が必要となります。
圧縮が適切に構成されていれば、監視ビデオの有用性を支える画質を損なうことなく、帯域幅やストレージへの負荷を大幅に軽減できます。その影響はストレージの節約にとどまらず、録画保持期間からネットワーク容量、さらにはクラウドコストに至るまで、あらゆるものに及びます。
ビットレートの数値だけでは、圧縮性能を正しく評価することはできません。カメラがより多くの映像情報を削ぎ落とせば、ビットレートを下げることは可能です。その結果、画質が低下し、ビデオの有用性が損なわれる可能性があります。本当に重要なのは、特定のビットレートにおいて、どれだけ詳細な情報を保持できているかです。実際の映像はどのような状態なのか、そして分析や証拠記録に必要なディテールが保持されているか。それが重要なのです。その比較は難しいかもしれません。隣り合わせに設置された2台のカメラであっても、捉える映像は同一ではありません。どんなシーンも全く同じではありません。ですから、圧縮性能の評価は、カメラが実際に使用される環境で行うのが最善です。
圧縮の影響は、ストレージや帯域幅だけに留まりません。選択する設定は、システムの効率と録画ビデオの品質の両方に影響を与えます。
AIがワークフローのどこで動作するかによって、その効果は大きく変わります。物体検知やナンバープレート認識といったAI分析は、圧縮を行う前のカメラ側で実行すべきです。圧縮されたビデオは、元の映像よりも視覚情報が少なくなり、これは分析がいかに正確に内容を解釈できるかという精度に影響を与えます。
カメラ、VMS、ストレージサーバー、そして視聴クライアントに至るまで、チェーン内のすべてのデバイスが同一のコーデックをサポートしている必要があります。H.264、H.265、そしてAV1に対応したカメラは、より高い柔軟性を提供します。これにより、既存のシステムとの連携が容易になるだけでなく、将来的なアップグレードにも対応可能です。
圧縮設定においては、画質と、ストレージおよび帯域幅の要件とのバランスをとる必要があります。圧縮が不十分だとリソース消費が増大し、逆に圧縮しすぎると、捜査や日常業務において重要な細部が見えにくくなってしまいます。
適切な設定は、撮影シーンや録画の目的に応じて異なります。圧縮性能のテストは、理想的な環境ではなく、実際の運用環境で行ってください。カメラごと、あるいはケースごとのビットレートを算出できる設計ツールを使えば、計画がよりスムーズに進められます。
ビットレートによって、ストレージがどれくらいの速さで一杯になるかが決まります。システムを導入または拡張する前には、カメラ1台あたりの予想ビットレートを算出し、それにカメラの台数と必要な録画期間を掛け合わせて計算してください。
導入時には手頃な価格に見えるシステムでも、ストレージの容量が予想より早く上限に達したり、後からカメラを追加したりして容量の再検討を行わなかった場合、コストが急増してしまう可能性があります。
AV1への対応は、クラウドプラットフォームや広範なソフトウェアエコシステム全体で拡大し続けています。デコーダーの対応が進むにつれ、H.265採用時に見られた課題も解消され始めており、AV1は新しい監視システムの導入において、より現実的な選択肢となりつつあります。
ビデオをクラウドへ移行する場合、圧縮効率の重要性はさらに高まります。なぜなら、ストレージ費用や転送コストはビットレートに比例して増大するからです。大規模な導入環境において、動画を長期間保存する場合、ビットレートをわずかに削減するだけでも、時間の経過とともに極めて大きな効果をもたらします。
クラウドベースの監視システムが拡大する中で、圧縮性能の指標として画質だけでは、もはや十分ではありません。
開発の焦点は、既存のコーデックの性能をいかに最大限に引き出すかへと、ますますシフトしています。エンコーディングは、シーンの内容や時間帯、活動量に応じて、動的に最適化されます。オーバーレイ表示の切り替え機能などにより、メタデータを映像ストリーム内に直接埋め込むことができます。これにより、追加の帯域を消費することなく、映像と構造化データを同時に配信することが可能です。
監視システムの継続的なコストにおいて、ストレージは最大の支出項目の一つです。解像度の向上や保存期間の長期化に伴い、その需要は増大し続けています。より効率的な圧縮技術により、このコスト増大を抑制することができます。低ビットレート化によりストレージ容量を削減できるだけでなく、システム全体の運用期間におけるハードウェアの必要数も抑えることが可能です。
ビデオ圧縮技術は現在も活発に開発が進められており、今後も新しい規格が次々と登場することでしょう。規格の移行には時間がかかり、既存のシステムも稼働させ続けなければなりません。優れた新しいコーデックとは、既存の導入環境を尊重し、それらとの互換性を維持できるものです。
新しい規格がすべて、市場に受け入れられるとは限りません。コーデックの採用は、技術的性能と同様に、ライセンス形態や業界の動向にも左右されます。多くの組織にとって、次にどのコーデックが主流になるかを予測することよりも、長期的な柔軟性を確保することの方が価値があります。
業界では現在、圧縮手法の一つとして生成AIの活用が模索されています。録画データは、調査や証拠として使用される必要があるため、ビデオはカメラが捉えた内容を正確に反映していなければなりません。
導入前のストレージ・帯域幅要件の予測により、不確実性を排除します。AXIS Site Designerを使用すれば、デバイスの構成からシステム要件の算出、さらには構成部品リストの作成まで、一連の作業をスムーズに行えます。
ビデオをどこに、どのように保存するかによって、監視システムが提供できる価値が決まります。適切なストレージ構成こそが、録画データのアクセシビリティを維持し、コストを予測可能にし、システムの拡張性を担保します。
監視ビデオの価値は、それが捉えたディテールの精度にかかっています。画像の有用性こそが、顔の識別、ナンバープレートの読み取り、あるいはイベントの把握ができるかどうかを決定づけます。解像度、照明、そして処理技術。これらが最適なバランスで結びつくことで、映像は活用可能な証拠へと変わります。