Programowanie: Techniki przyspieszania kodu
Ta strona zawiera proste metody, które mogą często znacząco przyspieszyć działanie programu.
Szybsze zapamiętywanie rejestrów w przerwaniach
Kiedy obsługujemy przerwania (np. DLI), powinniśmy zapisać wartości rejestrów, i odtworzyć je przy wyjściu (oczywiście, tylko rejestry, które będziemy modyfikowali). Typowo, jest to robione poprzez:
enter pha ; 3 cykle txa ; 2 pha ; 3 tya ; 2 pha ; 3 ... leave pla ; 4 tay ; 2 pla ; 4 tax ; 2 pla ; 4
To rozwiązanie, chociaż proste, zajmuje w sumie w sumie 29 cykli. W przypadkach, kiedy mamy dużo przerwań, np. DLI co 2 linie, jest szybsza metoda:
enter sta _value_a+1 ; 4 cykle stx _value_x+1 ; 4 sty _value_y+1 ; 4 ... leave _value_a lda #0 ; 2 _value_x ldx #0 ; 2 _value_y ldy #0 ; 2
To zajmuje 18 cykli, zatem pozwala oszczędzić 11 cykli na obsługę przerwania. Zajmuje 5 bajtów więcej, ale zazwyczaj ten koszt jest pomijalny.
Powyższą procedurę możemy umieścić w całości na stronie zerowej, przez co instrukcje sta,stx,sty value wykonają się o jeden cykl mniej, w ten sposób oszczędzamy 3 cykle na przerwanie. Jeżeli mamy np. przerwanie DLI co 1 linię ekranową występujące przez 200 linii rachunek wydaje sie prosty, oszczędzany 600 cykli. Zyskujemy trochę cykli kosztem zajęcia części strony zerowej poprzez kod procedury obsługi przerwania. Jednak czasami jest to opłacalne.
Strony zerowej można też użyć do przechowywania rejestrów, zmniejszy to dodatkowy koszt pamięci z 5 bajtów do 2, przy tym samym czasie wykonania:
zp_a $80 zp_x $81 zp_y $82 ... enter sta zp_a stx zp_x sty zp_y ... leave lda zp_a ldx zp_x ldy zp_y
To rozwiązanie jest dodatkowo przydatne w sytuacjach, gdy w procedurze przerwania mamy więcej niż jedno miejsce wyjścia, np w związku ze skokiem warunkowym.
Skoki do adresów w tablicy
Są sytuacje, gdzie chcemy skoczyć pod różny adres w zależności np od wartości rejestru Y. Przykładowym rozwiązaniem jest trzymanie tablicy adresów, podzielonych na lo/hi adres, i użycie automodyfikacji kodu (ten sam kod dla JSR i JMP):
lda skoki_lo,y ; 4 cykle sta _skok+1 ; 4 lda skoki_hi,y ; 4 sta _skok+2 ; 4 _skok jsr adres ; 6, lub JMP, 3 cykle
Innym sposobem na wykonanie skoku jest wykorzystanie właściwości rozkazu RTS. Nadal potrzebujemy tablic adresów, podzielonych na lo/hi adres-1 (koniecznie adres pomniejszony o 1). Takie rozwiązanie użyteczne jest w przypadku programów na karcie gdzie nie mamy możliwości automodyfikacji kodu.
lda skoki_hi,y ; 4 cykle pha ; 3 lda skoki_lo,y ; 4 pha ; 3 rts ; 6 = 20 cykli
Dla JSR, w sytuacji, gdy liczba skoków jest ograniczona do 86, możemy stworzyć specjalną dodatkową tablicę, zawierającą nie adresy skoków, ale rozkazy JMP, tzn:
skoki jmp skok1 ; 3 cykle jmp skok2 ... jmp skokN ; max N to 86
Jeśli ten kod umieścimy tak, że skoki rozpoczynają się na początku strony, możemy użyć następującej konstrukcji:
lda mul3,y ; 4 cykle sta _skok+1 ; 4 _skok jsr skoki ; 6
W ten sposób zaoszczędzamy 5 cykli, bo unikamy lda/sta (-8 cykli) ale dodajemy pośredni jmp (+3), kosztem dodatkowej pamięci.
Dla JMP, możemy to zrobić jeszcze inaczej, używając rozkazu JMP (adres). Nasza tablica skoki powinna zawierać po kolei adresy docelowe, czyli:
skoki dta a(skok1) dta a(skok2) ... dta a(skokN) ; max N to 128
I teraz nasz kod zamieniamy na
tya ; 2 cykle asl @ ; 2, mnożymy przez 2 sta _skok+1 ; 4 _skok jmp (skoki) ; 5
Oszczędzamy 6 cykli, bo usuwamy lda/sta (-8 cykli), ale zwiększamy koszt JMP z 3 do 5 (+2).
Odejmowanie od (2 do X)-1
Są sytuacje, gdy chcemy odjąć liczbę (M) od (potęgi 2)-1, np 1, 3, 7, 15, ..., 255 (N). Typowy kod:
lda N sec sbc M
Jeśli wiemy, że M jest mniejsza-równa N, możemy to zrobić szybciej:
lda M eor N
Jest to szczególnie przydatne, gdy M mamy pod ręką, np już w A, wtedy całe odejmowanie ogranicza się do eor.