Статьи с тегом «Расследование сбоев»
Статьи с тегом «Расследование сбоев» (17 шт.), от новых к старым.
-
Захват пакетов в Windows на практике — pktmon, netsh trace и Wireshark
Сбой связи, в журнале приложения которого остаётся только «timeout», разбирают по пакетам, которые реально прошли по проводу. Даже на сервере без Wireshark з...
-
Как читать «использование памяти» в Windows: Working Set, Private Bytes, Commit и файл подкачки
Столбец «Память» в диспетчере задач, Working Set, Private Bytes и Commit — это разные величины. Разбираем связь виртуальной и физической памяти Windows, роль...
-
Практики многопоточности на Java: что считать нормой в эпоху виртуальных потоков
В Java потоки не создают вручную: задачи отдают ExecutorService и виртуальным потокам. Разбираем, когда брать synchronized, а когда ReentrantLock, как остана...
-
Инцидент не закрывается восстановлением — постмортем для небольшой команды
Если закрыть инцидент после исправления и извинений, тот же сбой повторится. Адаптируем blameless-постмортем для небольшой команды: шаблон на час, таблица си...
-
Спящий режим, гибернация и Modern Standby: как не дать долгоживущему приложению остановиться ночью
Разбираем, почему долгоживущее Windows-приложение к утру оказывается остановленным: чем отличаются спящий режим S3, гибернация и Modern Standby, как во сне в...
-
Система без исходного кода и спецификаций: как сопровождать её, не останавливая работу
Практический порядок начала эксплуатации и сопровождения бизнес-системы, у которой нет ни исходного кода, ни спецификаций. От фиксации работающего окружения ...
-
Сетевые диски и UNC-пути: типичные ловушки ── как бизнес-приложению работать с файловым сервером (общей папкой)
Разбираем типичные сбои, когда бизнес-приложение пишет в общую папку или следит за ней. Почему службе не видна буква диска (Z:), какие права нужны для каждой...
-
Практическое руководство по Process Monitor (ProcMon) — за 10 минут находим «настройки не читаются» и ACCESS DENIED
Неисправности вроде «настройки поменял, а эффекта нет» разбирают в Process Monitor (ProcMon) по реальным обращениям к файлам и реестру. В статье — рабочие пр...
-
Как найти причину «тормозов» с PerfView и dotnet-trace — практика анализа производительности .NET
Когда бизнес-приложение тормозит или ЦП постоянно на максимуме, какой инструмент взять и на что смотреть. Разделение ролей PerfView и dotnet-trace, чтение сэ...
-
Журнал событий Windows и ETW: как вывести логи бизнес-приложения в стандартные механизмы ОС
Журнал событий и ETW — отдельный слой записей, который видят специалисты по эксплуатации и стандартные средства ОС. Разбираем, как разделить роли трёх механи...
-
Как читать аварийные дампы в WinDbg + SOS — практика анализа после сбора
Разбираем, как читать аварийный дамп Windows в WinDbg с расширением SOS: настройка пути к символам, поиск исключений и утечек через !clrstack и !dumpheap, ко...
-
Что продумать перед заказом разработки Windows-приложения
Перед заказом разработки Windows-приложения разберём, что стоит прояснить: доработка существующего ПО, интеграция с оборудованием, COM/ActiveX, развёртывание...
-
Как проектировать логи и дампы при сбое Windows-приложения
Разбираем, как сочетать лог штатной работы, маркер сбоя, WER LocalDumps и процесс-наблюдатель, чтобы даже после падения Windows-приложения из-за неожиданного...
-
Сбор дампов сбоев Windows — введение: WER, ProcDump, WinDbg
Чтобы расследовать трудно воспроизводимые сбои Windows-приложений, разбираем, как выбирать между WER LocalDumps, ProcDump, MiniDumpWriteDump и WinDbg и на чт...
-
Application Verifier: инфраструктура тестов нештатных путей Windows
Разбираем, что такое Application Verifier, и как с Handles, Heaps, Low Resource Simulation и !htrace строить инфраструктуру тестов нештатных путей Windows.
-
Утечка хендлов: почему приложение промышленной камеры падает после месяца работы
На примере приложения управления промышленной камерой разбираем, как смотреть на Windows-приложение, которое внезапно падает после длительной работы: как нах...
-
Почему повторная передача TCP останавливает обмен с промышленной камерой и как это диагностировать
Как диагностировать остановку обмена с промышленной камерой на несколько секунд из-за повторной передачи TCP: потеря пакетов, RTO, метки времени RFC1323 и на...