"if the user needs a two-sentence answer, don't generate an essay. If the downstream system needs JSON, don't ask for prose. " I find that LLM tends to generate long-winding repetitive responses without explicit and deliberate guidance like "please give me a 2-sentence summary. Please use Maths formulas to simplify"