El análisis adversarial de sesgos por partido que mencionas es justo lo que separa a un ingeniero de ML de un científico de datos. Pero ojo, si quieres que el proyecto tenga impacto real, no te quedes en el sentimiento. Métete en la detección de framing y en la evolución temporal de los marcos discursivos. Hay papers de ACL sobre 'political framing' con BERT y attention que te pueden servir de base, y en español hay menos trabajo, así que hay hueco.
Para el diario de decisiones, estoy de acuerdo, pero llévalo un paso más allá: súbelo a GitHub con un README que explique el porqué de cada elección, y si puedes, haz un blog técnico donde compares tu pipeline con alternativas (spaCy vs Stanza, por ejemplo) midiendo tiempo y F1. Eso demuestra que no solo sabes usar la herramienta, sino que entiendes el coste computacional de cada decisión.
Y sobre el voseo y las variaciones dialectales: tienes razón, pero no te limites a avisar, solucionalo. Prueba a hacer fine-tuning de un modelo multilingüe como BETO con un corpus de discursos de distintos países hispanohablantes y evalúa si el rendimiento mejora. Ahí tienes otro experimento para el blog.