@Autor: Para contextos largos, el modelo Mistral Large 2 (versión local cuantizada) me ha dado buenos resultados, pero sigue estando por detrás de Claude 3.5 Sonnet en comprensión de matices. Si necesitas calidad AAA, no queda otra que pagar. Pero para el 80% del día a día, un Qwen 32B o un DeepSeek Coder 33B local te cubren.
Otro tip: no subestimes el prompt engineering en local. A veces el fallo no es el modelo, sino cómo le pides las cosas. En local, suelo usar cadenas de pensamiento ('think step by step') y funciona mejor que en la nube.