|
| 1 | +# Copyright (c) nexB Inc. and others. All rights reserved. |
| 2 | +# SPDX-License-Identifier: Apache-2.0 |
| 3 | + |
| 4 | +"""Add model-predicted required phrases to ScanCode license rules.""" |
| 5 | + |
| 6 | +import os |
| 7 | +from pathlib import Path |
| 8 | + |
| 9 | +import click |
| 10 | + |
| 11 | +from licensedcode.models import rules_data_dir |
| 12 | +from licensedcode.required_phrases import add_required_phrase_to_rule |
| 13 | +from licensedcode.required_phrases import find_phrase_spans_in_text |
| 14 | +from licensedcode.required_phrases import get_base_rules_by_expression |
| 15 | +from licensedcode.required_phrases import RequiredPhraseRuleCandidate |
| 16 | +from licensedcode.tokenize import get_existing_required_phrase_spans |
| 17 | + |
| 18 | +from scancode_required_phrases.inference import RequiredPhrasePredictor |
| 19 | + |
| 20 | + |
| 21 | +MIN_TOKENS = 2 |
| 22 | +MIN_SINGLE_TOKEN_LEN = 5 |
| 23 | +MAX_RULE_TEXT = 4000 |
| 24 | + |
| 25 | + |
| 26 | +def load_predictor(model, hf_token=None): |
| 27 | + """Load a predictor from a local directory or Hugging Face repository.""" |
| 28 | + model_dir = Path(model) |
| 29 | + if not model_dir.is_dir(): |
| 30 | + from huggingface_hub import snapshot_download |
| 31 | + |
| 32 | + model_dir = Path(snapshot_download(repo_id=model, token=hf_token)) |
| 33 | + return RequiredPhrasePredictor.from_model_dir(model_dir) |
| 34 | + |
| 35 | + |
| 36 | +def is_updatable(rule): |
| 37 | + """Return True if a rule can receive predicted required phrases.""" |
| 38 | + if rule.is_from_license: |
| 39 | + return False |
| 40 | + if len(rule.text) > MAX_RULE_TEXT: |
| 41 | + return False |
| 42 | + if not rule.is_approx_matchable: |
| 43 | + return False |
| 44 | + if rule.skip_for_required_phrase_generation: |
| 45 | + return False |
| 46 | + return not get_existing_required_phrase_spans(rule.text) |
| 47 | + |
| 48 | + |
| 49 | +def select_rules(license_expression=None): |
| 50 | + """Return eligible rules grouped by license expression.""" |
| 51 | + try: |
| 52 | + rules_by_expression = get_base_rules_by_expression(license_expression) |
| 53 | + except KeyError: |
| 54 | + raise click.ClickException( |
| 55 | + f"No rules for license expression: {license_expression}" |
| 56 | + ) from None |
| 57 | + |
| 58 | + selected = {} |
| 59 | + for expression, rules in rules_by_expression.items(): |
| 60 | + updatable = [rule for rule in rules if is_updatable(rule)] |
| 61 | + if updatable: |
| 62 | + selected[expression] = updatable |
| 63 | + return selected |
| 64 | + |
| 65 | + |
| 66 | +def new_counts(): |
| 67 | + return dict( |
| 68 | + rules=0, |
| 69 | + truncated=0, |
| 70 | + rejected=0, |
| 71 | + not_found=0, |
| 72 | + injected=0, |
| 73 | + skipped=0, |
| 74 | + written=0, |
| 75 | + ) |
| 76 | + |
| 77 | + |
| 78 | +def add_predicted_phrases(rule, phrases, counts, dry_run=False, verbose=False): |
| 79 | + """Validate and add predicted phrases, writing the rule at most once.""" |
| 80 | + candidates = [] |
| 81 | + for phrase in phrases: |
| 82 | + candidate = RequiredPhraseRuleCandidate.create(rule.license_expression, phrase) |
| 83 | + if not candidate.is_good(rule, MIN_TOKENS, MIN_SINGLE_TOKEN_LEN): |
| 84 | + counts["rejected"] += 1 |
| 85 | + continue |
| 86 | + if not find_phrase_spans_in_text(rule.text, phrase): |
| 87 | + counts["not_found"] += 1 |
| 88 | + continue |
| 89 | + candidates.append(phrase) |
| 90 | + |
| 91 | + if not candidates: |
| 92 | + return False |
| 93 | + |
| 94 | + original_text = rule.text |
| 95 | + original_source = rule.source |
| 96 | + source = f"{original_source} ml_model" if original_source else "ml_model" |
| 97 | + |
| 98 | + for phrase in candidates: |
| 99 | + updated = add_required_phrase_to_rule( |
| 100 | + rule=rule, |
| 101 | + required_phrase=phrase, |
| 102 | + source=source, |
| 103 | + debug=verbose, |
| 104 | + dry_run=True, |
| 105 | + ) |
| 106 | + if updated: |
| 107 | + counts["injected"] += 1 |
| 108 | + else: |
| 109 | + counts["skipped"] += 1 |
| 110 | + |
| 111 | + if rule.text == original_text: |
| 112 | + return False |
| 113 | + if not dry_run: |
| 114 | + rule.dump(rules_data_dir) |
| 115 | + return True |
| 116 | + |
| 117 | + |
| 118 | +def update_rules_from_predictions( |
| 119 | + selected, |
| 120 | + predictor, |
| 121 | + dry_run=False, |
| 122 | + limit=0, |
| 123 | + verbose=False, |
| 124 | +): |
| 125 | + """Predict and add phrases to selected rules and return run counts.""" |
| 126 | + counts = new_counts() |
| 127 | + total = sum(len(rules) for rules in selected.values()) |
| 128 | + click.echo(f"Predicting required phrases for {total} rules") |
| 129 | + |
| 130 | + for expression, rules in selected.items(): |
| 131 | + if verbose: |
| 132 | + click.echo(f"{expression}: {len(rules)} rules") |
| 133 | + |
| 134 | + for rule in rules: |
| 135 | + if limit and counts["rules"] >= limit: |
| 136 | + click.echo(f"Stopping at {limit} rules") |
| 137 | + return counts |
| 138 | + |
| 139 | + counts["rules"] += 1 |
| 140 | + result = predictor.predict(rule.text) |
| 141 | + if result.truncated: |
| 142 | + counts["truncated"] += 1 |
| 143 | + phrases = [prediction.text for prediction in result.phrases] |
| 144 | + if not phrases: |
| 145 | + continue |
| 146 | + |
| 147 | + if verbose: |
| 148 | + click.echo(f" {rule.identifier}: {phrases}") |
| 149 | + if add_predicted_phrases( |
| 150 | + rule=rule, |
| 151 | + phrases=phrases, |
| 152 | + counts=counts, |
| 153 | + dry_run=dry_run, |
| 154 | + verbose=verbose, |
| 155 | + ): |
| 156 | + counts["written"] += 1 |
| 157 | + |
| 158 | + return counts |
| 159 | + |
| 160 | + |
| 161 | +@click.command(name="add-model-required-phrases") |
| 162 | +@click.option( |
| 163 | + "--model", |
| 164 | + required=True, |
| 165 | + help="Final model directory or Hugging Face repository.", |
| 166 | +) |
| 167 | +@click.option( |
| 168 | + "--license-expression", |
| 169 | + help="Only update rules for this license expression.", |
| 170 | +) |
| 171 | +@click.option( |
| 172 | + "--dry-run", |
| 173 | + is_flag=True, |
| 174 | + help="Predict and validate phrases without saving rules.", |
| 175 | +) |
| 176 | +@click.option( |
| 177 | + "--limit", |
| 178 | + default=0, |
| 179 | + type=click.IntRange(min=0), |
| 180 | + help="Stop after this many rules; zero processes all rules.", |
| 181 | +) |
| 182 | +@click.option( |
| 183 | + "-v", |
| 184 | + "--verbose", |
| 185 | + is_flag=True, |
| 186 | + help="Print predictions for each rule.", |
| 187 | +) |
| 188 | +@click.help_option("-h", "--help") |
| 189 | +def add_model_required_phrases(model, license_expression, dry_run, limit, verbose): |
| 190 | + """Add model-predicted required phrases to license rules.""" |
| 191 | + selected = select_rules(license_expression=license_expression) |
| 192 | + if not selected: |
| 193 | + click.echo("No eligible rules found") |
| 194 | + return |
| 195 | + |
| 196 | + predictor = load_predictor(model, hf_token=os.environ.get("HF_TOKEN")) |
| 197 | + counts = update_rules_from_predictions( |
| 198 | + selected=selected, |
| 199 | + predictor=predictor, |
| 200 | + dry_run=dry_run, |
| 201 | + limit=limit, |
| 202 | + verbose=verbose, |
| 203 | + ) |
| 204 | + |
| 205 | + click.echo(f"\nrules processed : {counts['rules']}") |
| 206 | + click.echo(f" truncated : {counts['truncated']}") |
| 207 | + click.echo(f"phrases injected : {counts['injected']}") |
| 208 | + click.echo(f" rejected : {counts['rejected']}") |
| 209 | + click.echo(f" not found : {counts['not_found']}") |
| 210 | + click.echo(f" nothing to add : {counts['skipped']}") |
| 211 | + click.echo(f"rules written : {counts['written']}") |
| 212 | + |
| 213 | + if dry_run: |
| 214 | + click.echo("Dry run: no rules were saved") |
| 215 | + elif counts["written"]: |
| 216 | + click.echo("Run scancode-reindex-licenses to use the new required phrases") |
| 217 | + |
| 218 | + |
| 219 | +if __name__ == "__main__": |
| 220 | + add_model_required_phrases() |
0 commit comments