ARM-Prozessoren und C

vorhergehende Artikel in: Java Linux Video Numerik C und C++

OK - so weit war auch der ursprüngliche Verfassers gekommen und so weit decken sich die Ergebnisse mit seinen. Wie sieht es aber aus, wenn wir eine andere Prozessorarchitektur nutzen - zum Beispiel ARM? Ich habe dazu die oben bereits eingeführten Funktionen wieder als C-Quelltext mit GCC auf einem Raspberry Pi 3B+ mit denselben Kommandozeilenschaltern übersetzt und präsentiere hier zunächst die Ergebnisse für die einfache Methode max - zuerst ohne branchless:

max:
        cmp     r0, r1
        movlt   r0, r1
        bx      lr

Vergleicht man dies mit dem Ergebnis der Übersetzung der branchless-Variante:

max1:
        cmp     r0, r1
        movle   r0, #0
        movgt   r1, #0
        add     r0, r0, r1
        bx      lr

Erkennt man auch hier, dass in trivialen Fällen der Compiler eine bessere Arbeit verrichtet als der Programmierer. Wie sieht es nun in dem nicht mehr ganz so trivialen Fall toUpper aus? Zunächst wieder die "normale" Variante:

toUpper:
        ldrb    r3, [r0]        @ zero_extendqisi2
        cmp     r3, #0
        bxeq    lr
.L8:
        sub     r2, r3, #32
        sub     r3, r3, #97
        cmp     r3, #25
        bhi     .L6
.L16:
        strb    r2, [r0]
        ldrb    r3, [r0, #1]!   @ zero_extendqisi2
        cmp     r3, #0
        bxeq    lr
        sub     r2, r3, #32
        sub     r3, r3, #97
        cmp     r3, #25
        bls     .L16
.L6:
        ldrb    r3, [r0, #1]!   @ zero_extendqisi2
        cmp     r3, #0
        bne     .L8
        bx      lr

Und nun die branchless Variante:

toUpper1:
        ldrb    r3, [r0]        @ zero_extendqisi2
        cmp     r3, #0
        bxeq    lr
.L19:
        sub     r2, r3, #97
        cmp     r2, #25
        movls   r2, #32
        movhi   r2, #0
        sub     r3, r3, r2
        strb    r3, [r0]
        ldrb    r3, [r0, #1]!   @ zero_extendqisi2
        cmp     r3, #0
        bne     .L19
        bx      lr

Hier treffen die Aussagen, die bereits für die x86-Architektur gemacht wurden voll zu: Zum einen ist der Code kürzer und außerdem mit wesentlich weniger bedingten Sprüngen durchsetzt - daher besteht der Verdacht, dass es sich lohnen kann, diesen zusätzlichen Aufwand auch für Programme auf ARM-Prozessoren an performancekritischen Stellen zu treiben.

Kommentar hinzufügen (via Github ) Kommentare ansehen (via Github )

Kommentar hinzufügen (via ) Kommentare ansehen (via )

Vor 5 Jahren hier im Blog

Fährnisse des Buildprozesses unter Windows

17.07.2019

Nachdem ich begonnen hatte, mich mit der Beschleunigung der Berechnung des Mandelbrot-Fraktals unter Zuhilfenahme der Shadereinheiten in Graphikkarten zu beschäftigen und erste Erfolge feiern konnte, wollte ich das mal auf einer richtigen Graphikkarte ausprobieren...
Weiterlesen...

Neueste Artikel

Datenvalidierung UTF8 mit BiDi-Steuerzeichen (TrojanSource 2.0)

Ich bin heute nochmal inspiriert worden, weiter über die Trojan Source Vulnerability nachzudenken. Meiner Meinung nach bestehen hier noch Probleme - speziell bei Nutzereingaben oder Daten, die über externe Schnittstellen ampfangen werden.
Weiterlesen...
OpenStreetMap Navi als Docker-Container

Ich habe die auf OpenStreetMap basierende OpenSource Navigationslösung Graphhopper in einen Docker-Container gepackt und als neuestes Mitglied in meinem Docker-Zoo willkommen geheißen.
Weiterlesen...
SQL-Aggregatfunktionen in SQLite als BeanShell-Scripts

Ich habe neulich über eine Möglichkeit berichtet, SQLite mittels der sQLshell und Beanshell-Skripten um SQL-Funktionen zu erweitern. In diesem Artikel versprach ich auch, über eine solche Möglichkeit für Aggregatfunktionen zu berichten.
Weiterlesen...

Manche nennen es Blog, manche Web-Seite - ich schreibe hier hin und wieder über meine Erlebnisse, Rückschläge und Erleuchtungen bei meinen Hobbies.

Wer daran teilhaben und eventuell sogar davon profitieren möchte, muß damit leben, daß ich hin und wieder kleine Ausflüge in Bereiche mache, die nichts mit IT, Administration oder Softwareentwicklung zu tun haben.

Ich wünsche allen Lesern viel Spaß und hin und wieder einen kleinen AHA!-Effekt...

PS: Meine öffentlichen GitHub-Repositories findet man hier - meine öffentlichen GitLab-Repositories finden sich dagegen hier.

ARM-Prozessoren und C

Vor 5 Jahren hier im Blog

Tags

Neueste Artikel

Der Verfasser