Skip to content

CondonFM Skills - #4

Open
ohadmo wants to merge 10 commits into
mainfrom
omosafi/skills
Open

ohadmo wants to merge 10 commits into
mainfrom
omosafi/skills

Conversation

@ohadmo

@ohadmo ohadmo commented Sep 3, 2026

Copy link
Copy Markdown
Contributor

This repository is read-only and does not accept Pull Requests. Please open an Issue for reproducible bugs.

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo
ohadmo requested a review from caofan September 3, 2026 23:11
@ohadmo ohadmo self-assigned this Sep 3, 2026
@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

Thanks for your interest. This repository is read-only and does not accept Pull Requests. Please open an Issue for reproducible bugs.

@github-actions github-actions Bot closed this Sep 3, 2026
@ohadmo ohadmo reopened this Sep 3, 2026
@github-actions

github-actions Bot commented Sep 3, 2026

Copy link
Copy Markdown

Thanks for your interest. This repository is read-only and does not accept Pull Requests. Please open an Issue for reproducible bugs.

@github-actions github-actions Bot closed this Sep 3, 2026
@ohadmo ohadmo reopened this Sep 4, 2026
@ohadmo

ohadmo commented Sep 4, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

@ohadmo

ohadmo commented Sep 4, 2026

Copy link
Copy Markdown
Contributor Author

@greptileai

@greptile-apps

greptile-apps Bot commented Sep 4, 2026

Copy link
Copy Markdown

RetriggerConfidence Score: 5/5

The changes since the previous review appear safe to merge, with no actionable new defect identified.

Summary

Adds generated publication artifacts for four CodonFM skills:

  • Records Tier 1–3 benchmark results and publication recommendations.
  • Adds skill cards describing ownership, use cases, dependencies, outputs, and evaluation results.
  • Attaches Sigstore bundles covering each packaged skill’s resources.

Diagram

%%{init: {'theme': 'neutral'}}%%
flowchart TD
  A[CodonFM skill source and evaluations] --> B[Tier 1-3 evaluation]
  B --> C[BENCHMARK.md]
  B --> D[skill-card.md]
  C --> E[Packaged skill resources]
  D --> E
  E --> F[skill.oms.sig]
  F --> G[NVSkills publication validation]
Loading

Reviews (8) · Last reviewed commit: "Attach NVSkills validation signatures"

@ohadmo

ohadmo commented Sep 4, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

1 similar comment
@ohadmo

ohadmo commented Sep 4, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 9, 2026

Copy link
Copy Markdown
Contributor Author

@greptileai

@ohadmo

ohadmo commented Sep 9, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 10, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

1 similar comment
@ohadmo

ohadmo commented Sep 10, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

@chrisknvidia

Copy link
Copy Markdown

@ohadmo : I did some debugging of the failures,
Suggestion for the resource-intensive Tier 3 evaluations:
Please add the following to skills/codonfm-score/evals/config.yml

schema_version: 1

harbor:
  timeout_multiplier: 4
  sandbox:
    templates:
      claude-code: harbor-eval-claude-code-8g
      codex: harbor-eval-codex-8g
  • timeout_multiplier: 4 applies to both agents.
  • Each template applies to both the with-skill and baseline arm for that agent.
  • The Claude mapping is especially relevant because the latest remaining failure occurred in the Claude baseline.
  • This provides equal resource headroom, but a rerun is still required.

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 10, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

1 similar comment
@ohadmo

ohadmo commented Sep 14, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

@chrisknvidia

Copy link
Copy Markdown

@ohadmo : I tested the two previously failing codonfm-score cases end to end using Claude Opus 5 through NVCARPS → SkillEvaluator → Harbor → Astra.

  • Resolved model: aws/anthropic/bedrock-claude-opus-5
  • Coverage: valid_full
  • Claude results: 4/4 scored, with zero failed attempts or policy refusals
  • Attempts 2–3 were correctly skipped because every case passed on attempt 1
  • Test MR !94
  • Successful Tier 3 job

https://github.com/NVIDIA-BioNeMo/CodonFM/blob/3f95e4e01604dbe7fda83d5563ef7a55d3134772/skills/codonfm-score/evals/evals.json

Could you please add the following per-skill override to skills/codonfm-score/evals/config.yml and rerun the complete PR evaluation?

schema_version: 1

harbor:
  agents:
    claude-code:
      model: aws/anthropic/bedrock-claude-opus-5

This changes only the Claude model for codonfm-score; the Codex configuration remains unchanged. The controlled test confirms that Opus 5 avoids the refusals for the two previously failing cases. The complete PR rerun will confirm it across the full dataset.

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 17, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 17, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

Signed-off-by: Ohad Mosafi <omosafi@nvidia.com>
@ohadmo

ohadmo commented Sep 18, 2026

Copy link
Copy Markdown
Contributor Author

/nvskills-ci

Signed-off-by: nvskills-svc-account <svc-nvskills-signing@nvidia.com>
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

3 participants