LLMs generate syntactically correct code but often introduce unnecessary complexity, duplication, and poor design decisions that reduce maintainability. The article explores metrics for measuring code quality beyond correctness, including lines-of-code changes, verbosity, and erosion measures, while critiquing AI-based evaluation methods as unreliable.