Data contamination is a critical problem in LLM research: it occurs when a model’s training data overlaps with its evaluation set, inflating scores and masking real capability gaps. FuncBenchGen avoids this by generating synthetic function-calling tasks at evaluation time. Each task is built from a controllable function-dependency DAG with adjustable depth, branching, and distractor functions, so no fixed test set can leak into training.