W trakcie przepisywania rozmowy z pliku audio bardzo szybko okazuje się, że najwięcej trudności nie wynika z samego pisania, lecz z konieczności właściwego odczytania tego, co de facto zostało powiedziane. Nagranie może zawierać dłuższe przerwy, zmiany tematu, poprawianie własnych wypowiedzi albo fragmenty wypowiadane bardzo cicho. Transkrypcja nagrań wymaga więc jednoczesnego słuchania i zapisywania informacji w sposób uporządkowany.
Przy łatwych rozmowach wystarcza zwykle rozpoznanie kolejnych wypowiedzi, natomiast przy bardziej złożonym materiale dochodzi identyfikacja osób, kontrolowanie kolejności oraz zaznaczanie miejsc, których nie można dobitnie odczytać. Ważne jest również rozróżnienie pomiędzy zapisem dosłownym a treścią po redakcji. W pierwszym przypadku pozostawia się naturalne cechy mowy, takie jak powtórzenia czy niedokończone zdania. W drugim można ograniczyć elementy utrudniające lekturę, jednak każda ingerencja w treść powinna mieć konkretny cel i nie może prowadzić do zmiany znaczenia wypowiedzi.
Duże znaczenie ma jakość samego nagrania. Plik zarejestrowany w cichym pomieszczeniu daje całkiem inne sposobności niż materiał pochodzący z miejsca, w którym słychać ruch uliczny, pracujące urządzenia albo kilka rozmów prowadzonych równocześnie. Problematyczne bywają także nagrania z telefonu, gdy urządzenie znajduje się daleko od osoby mówiącej. W takich ustaleniach pojedyncze słowa mogą być trudne do rozpoznania, a próba odtworzenia ich wyłącznie na podstawie kontekstu prowadzi do ryzyka błędu. W praktyce lepiej pozostawić oznaczenie niezrozumiałego fragmentu niż wpisać frazę, które tylko może się wydawać prawdopodobne. Przy dłuższych materiałach przydaje się również oznaczanie czasu nagrania. Daje możliwość ono bardzo szybko wrócić do dokładnie sprecyzowanej wypowiedzi i porównać zapis z oryginalnym plikiem. Ma to znaczenie szczególnie wówczas, gdy dokument będzie analizowany przez osoby, które nie uczestniczyły w rozmowie.
W materiałach związanych z postępowaniem prawnym sposób opracowania zapisu może posiadać dodatkowe znaczenie. Transkrypcja do sądu powinna przedstawiać tekst nagrania w sposób czytelny, ale bez swobodnego interpretowania wypowiedzi uczestników. Nie trzeba poprawiać sensu zdania wyłącznie dlatego, że rozmówca użył błędnej formy językowej lub przerwał wypowiedź w połowie (więcej informacji na stronie:transkrypcja cennik). Jeżeli już na nagraniu występuje kilka osób, konieczne jest konsekwentne oznaczanie ich wypowiedzi. Jeszcze trudniejsza sytuacja pojawia się przy mówieniu jednoczesnym, ponieważ wówczas nie zawsze da się ustalić pełną tekst obu wypowiedzi. W tak zaistniałej okoliczności warto podkreślić nakładanie się głosów, zamiast tworzyć pozornie kompletny zapis. Znaczenie mogą mieć także dłuższe pauzy, śmiech, podniesiony głos czy odgłosy wskazujące na reakcję uczestników, o ile są wyraźnie słyszalne i istotne dla przebiegu rozmowy.
W zależności od celu dokumentu wykorzystuje się różnorakie sposoby przedstawiania materiału. Stenogram może być przygotowany w formie bardzo zbliżonej do rzeczywistego przebiegu rozmowy, z zachowaniem kolejności wypowiedzi i charakterystycznych elementów mowy. Przy innych zastosowaniach tekst może zostać uporządkowany tak, aby łatwiej było znaleźć dokładnie określone informacje, bez zmieniania ich znaczenia. W obu przypadkach na prawdę istotna pozostaje konsekwencja przy stosowaniu oznaczeń a także dokładne sprawdzanie nazwisk, dat, liczb i nazw własnych. To właśnie takie detale są podatne na pomyłki, w szczególności gdy dźwięk jest niewyraźny albo rozmówca posługuje się niewiele znanym określeniem. Przy pracy z nagraniem warto też pamiętać, że treść nie oddaje wszystkich cech komunikacji ustnej. Nie każdą intonację czy emocję można dobitnie opisać, dlatego zapis powinien oddzielać to, co de fakto wynika z nagrania, od interpretacji osoby przygotowującej dokument.
Źródło: transkrypcja do sądu.