メディアのインデックス作成では、CPU、ストレージ、メモリ、データベース、アクセラレーターがアイドル時間を減らして動作するため、順次バックアップよりNASが高温になることがあります。
バックアップでは、大きな領域を順番に読み取り、順番に書き込むことが多いため、ディスク、キャッシュ、DMAエンジンが効率的に動作できます。一方、メディアのインデックス作成では、多数のファイルを開き、ヘッダーや散在するフレームを読み取り、コーデックをデコードし、ハッシュを計算し、サムネイルを生成し、データベースを更新し、顔認識や物体認識モデルを実行する場合があります。そのため、総スループットが低くても、処理したバイトあたりの消費電力は大きくなることがあります。
メタデータの走査と小さなファイルが、効率的な順次I/Oに取って代わる
インデクサーはディレクトリを走査し、エントリの属性を取得し、ファイルを開き、小さな領域を読み取り、閉じて、進行状況の記録を更新します。機械式ディスクでは、メタデータとコンテンツの間でシークが発生します。SSDはランダムアクセスをより適切に処理できますが、有用な1バイトあたりに実行するコマンド数やコントローラーの処理は依然として増えます。
小さなファイルのメタデータオーバーヘッドに関する研究は、小さなファイルのワークロードがバルク転送ではなくメタデータ操作に支配される理由を示しています。この違いにより、インデクサーは順次帯域幅に近づかなくても、ストレージスタックを稼働させ続けることができます。この違いは、その後の家庭環境でのテストでも確認できます。
バックアップでもメタデータを走査することはありますが、大きなファイルを選択すると、長い領域をストリーミングできます。先読みとキューの統合がうまく機能するため、移動する1ギガバイトごとのCPUウェイクアップとデバイスのオーバーヘッドを削減できます。自動化を進める前に、中間結果を検証可能な状態に保つ必要があります。
メディアのデコードと派生アセットが、すべてのファイルに計算処理を加える
バイトの読み取りは始まりにすぎません。写真の向きの判定、RAWデコード、動画のキーフレーム検索、音声解析、知覚ハッシュの計算、サムネイルの拡大縮小、トランスコードによってベクトルユニットやコーデックが稼働し、AIによる分類ではiGPU、GPU、またはニューラルアクセラレーターを使用する場合があります。
メディアのインデックス作成ジョブのプロジェクトでは、高度な認識の前にメタデータを抽出し、サムネイルを作成するメディア分析パイプラインについて説明しています。検索可能なメディアに、バイト単位のバックアップにはない処理が必要な理由が分かります。この境界は、現実的な運用条件で個別に測定する必要があります。
デコードされた画像は圧縮ファイルよりはるかに大きく、メモリトラフィックを発生させます。データベースやサムネイルへの書き込みによって、読み取り中心のスキャンも混合ワークロードとなり、ディスクとプロセッサーが1つの効率的な動作モードに落ち着くのを妨げます。
発熱は電力配分、冷却、処理時間を反映する
温度は、処理量を直接示す指標ではありません。同じワット数でも、ファンカーブ、ドライブの配置、筐体内のエアフロー、周囲温度、CPUとディスクが同時に筐体を加熱しているかどうかによって、センサーの読み取り値は異なります。
サーバーの電力と熱の測定に関するレビューでは、サーバーの電力が冷却システムによって除去すべき熱になる仕組みを説明しています。そのため、転送速度のグラフだけでなく、コンポーネントの使用率とエアフローが重要です。複数の処理が限られたコンテキストを奪い合うと、この実際の影響が現れます。
1つの温度センサーだけを見て、インデックス作成の効率が低いと結論付けるのは誤りです。バックアップのほうがはるかに多くのデータを移動し、総エネルギーを多く消費していても、ピーク温度は低い場合があります。エネルギー、処理時間、コンポーネントの消費電力、完了した処理量を比較してください。
インデックス作成とバックアップの1ギガバイトあたりのエネルギーを比較する
同じ熱的な基準状態から、インデックス作成とバックアップを別々に実行します。壁面電力、CPUパッケージ電力、アクセラレーターの使用状況、ディスクアクティビティ、IOPS、スループット、温度、ファン速度、処理したファイル数、読み書きしたバイト数、サムネイル数、ハッシュ数、データベースコミット数、モデル推論数を記録してください。
メディアのインデックス作成ワークフローを使ってインデクサーの各段階を整理し、次にサムネイル、動画解析、AIジョブを一度に1つずつ無効にして再度実行します。比較の間は、ファイルセット、周囲温度、筐体、キャッシュの状態を維持してください。この依存関係は、最終インターフェースでも明示したままにする必要があります。
ピーク温度と併せて、ファイルあたりおよび元データの1ギガバイトあたりのジュール数を報告してください。ランダムなメタデータ処理が支配的なら、スキャンをバッチ処理し、スケジュールを設定します。デコードやAI処理が支配的なら、ワーカー数を制限します。エアフローが支配的なら冷却を改善します。ただし、温度が下がったことを計算量が減ったことと取り違えないでください。
テック&AIハブ
もっと読む

なぜSMBファイルの変更はインクリメンタルインデクサーにバースト状に届くのか?
SMBの書き込みキャッシュ、リース、CHANGE_NOTIFY、バッファーオーバーフロー、再接続、インデクサーのバッチ処理によって、継続的な編集がバースト状の取り込みイベントへと変化する様子をご覧ください。

PDFを再圧縮すると、なぜOCRは薄い文字を認識できなくなるのか?
PDFの再圧縮によって淡いピクセルがどう変化するのか、ビューアーがその劣化を隠せる理由、さらに解像度、コントラスト、コーデック、OCRの前処理をテストする方法を学びます。

ホームサーバーのファンカーブでローカルAIのレイテンシーが変動するのはなぜですか?
熱、ファン制御、クロック制限、センサーの遅延、ワークロードのタイミングがどのように周期的なローカルAIの遅延を引き起こすのか、そしてその関係をどのように証明するかをご覧ください。

