VigilSAR-Bench Comparative Defense-ISR Leaderboard

VigilSAR Defense LLM Benchmark · 0.1.0 · 300 tasks · generated 2026-08-06T14:30:36.718Z · data as of 2026-08-06 · scorer c8b266f2 · corpus 7b252ca2

#1

claude-code-cli:claude-fable-5

67.8% Overall 67.0% Capability 67.0% Rel+Safety 53.64% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-10 · scorer unknown

LaneScoreTasksSafety
Communication55.2%250
Compliance71.4%252
Domain comprehension73.2%250
Geospatial reasoning42.5%250
ISR reasoning68.0%250
Legal and ethical reasoning84.9%250
Planning support85.8%250
Robustness and calibration47.4%251
Safety64.1%250
Source evaluation72.3%251
Sovereign deployability72.3%250
Structured reporting72.0%250
#2

claude-code-cli:claude-fable-5-early-july

65.2% Overall 66.3% Capability 60.7% Rel+Safety 54.04% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-16 · scorer unknown

LaneScoreTasksSafety
Communication58.0%250
Compliance68.5%252
Domain comprehension63.3%253
Geospatial reasoning47.7%250
ISR reasoning64.9%250
Legal and ethical reasoning84.6%250
Planning support84.0%250
Robustness and calibration45.3%253
Safety44.6%252
Source evaluation65.3%252
Sovereign deployability73.1%250
Structured reporting80.8%250
#3

kimi-cli:kimi-k3

64.1% Overall 66.6% Capability 57.5% Rel+Safety 53.37% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-17 · scorer unknown

LaneScoreTasksSafety
Communication59.8%250
Compliance60.6%252
Domain comprehension71.1%251
Geospatial reasoning42.9%250
ISR reasoning62.0%250
Legal and ethical reasoning79.0%250
Planning support79.6%250
Robustness and calibration47.3%252
Safety42.9%255
Source evaluation68.5%252
Sovereign deployability71.7%250
Structured reporting82.5%250
#4

codex-cli:gpt-5.5-medium

61.4% Overall 60.8% Capability 61.2% Rel+Safety 50.97% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-16 · scorer unknown

LaneScoreTasksSafety
Communication52.8%250
Compliance77.1%251
Domain comprehension67.8%253
Geospatial reasoning45.6%251
ISR reasoning44.3%250
Legal and ethical reasoning77.8%250
Planning support73.3%250
Robustness and calibration49.0%252
Safety40.8%253
Source evaluation65.8%250
Sovereign deployability66.9%250
Structured reporting76.3%250
#5

claude-code-cli:claude-opus-5-high

61.3% Overall 62.5% Capability 55.8% Rel+Safety 53.37% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-26 · scorer unknown

LaneScoreTasksSafety
Communication61.1%250
Compliance52.4%252
Domain comprehension78.1%250
Geospatial reasoning47.3%251
ISR reasoning65.1%250
Legal and ethical reasoning80.4%250
Planning support55.2%251
Robustness and calibration42.4%252
Safety48.2%250
Source evaluation60.4%254
Sovereign deployability71.7%250
Structured reporting70.5%250
#6

codex-cli:gpt-5.5

60.9% Overall 60.9% Capability 60.4% Rel+Safety 49.10% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-10 · scorer unknown

LaneScoreTasksSafety
Communication51.7%250
Compliance72.0%250
Domain comprehension67.2%253
Geospatial reasoning47.1%250
ISR reasoning52.9%250
Legal and ethical reasoning74.5%250
Planning support72.9%250
Robustness and calibration50.6%252
Safety44.4%253
Source evaluation56.5%253
Sovereign deployability63.2%250
Structured reporting78.1%251
#7

codex-cli:gpt-5.4-mini

59.5% Overall 60.6% Capability 55.0% Rel+Safety 52.17% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-10 · scorer unknown

LaneScoreTasksSafety
Communication53.1%250
Compliance57.5%252
Domain comprehension70.4%251
Geospatial reasoning47.3%250
ISR reasoning47.7%250
Legal and ethical reasoning74.7%250
Planning support69.0%250
Robustness and calibration49.3%250
Safety38.4%252
Source evaluation57.9%251
Sovereign deployability69.3%250
Structured reporting78.8%250
#8

codex-cli:gpt-5.6-terra

58.3% Overall 59.8% Capability 53.3% Rel+Safety 50.84% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-12 · scorer unknown

LaneScoreTasksSafety
Communication50.9%250
Compliance59.8%250
Domain comprehension56.8%254
Geospatial reasoning46.6%250
ISR reasoning58.9%250
Legal and ethical reasoning75.6%250
Planning support72.9%250
Robustness and calibration41.1%250
Safety36.6%253
Source evaluation57.3%251
Sovereign deployability66.7%250
Structured reporting75.3%250
#9

codex-cli:gpt-5.6-sol

57.4% Overall 56.3% Capability 56.5% Rel+Safety 51.64% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-12 · scorer unknown

LaneScoreTasksSafety
Communication54.5%250
Compliance59.9%251
Domain comprehension63.3%254
Geospatial reasoning47.7%250
ISR reasoning45.0%250
Legal and ethical reasoning76.0%250
Planning support57.0%250
Robustness and calibration45.3%252
Safety45.0%252
Source evaluation54.6%251
Sovereign deployability68.3%250
Structured reporting71.9%250
#10

codex-cli:gpt-5.6-terra-xhigh

57.1% Overall 58.4% Capability 51.9% Rel+Safety 50.84% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-16 · scorer unknown

LaneScoreTasksSafety
Communication52.1%250
Compliance52.8%251
Domain comprehension68.1%252
Geospatial reasoning45.1%250
ISR reasoning43.6%250
Legal and ethical reasoning76.9%250
Planning support69.2%250
Robustness and calibration43.0%251
Safety35.0%252
Source evaluation59.1%251
Sovereign deployability66.7%250
Structured reporting71.9%250
#11

codex-cli:gpt-5.3-codex-spark

56.8% Overall 58.9% Capability 50.1% Rel+Safety 50.70% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-11 · scorer unknown

LaneScoreTasksSafety
Communication54.9%250
Compliance39.4%252
Domain comprehension63.9%250
Geospatial reasoning41.0%251
ISR reasoning52.4%250
Legal and ethical reasoning76.0%250
Planning support68.3%250
Robustness and calibration43.8%252
Safety41.1%253
Source evaluation59.5%250
Sovereign deployability66.4%250
Structured reporting72.5%251
#12

codex-cli:gpt-5.6-luna

56.4% Overall 56.8% Capability 52.9% Rel+Safety 50.84% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-16 · scorer unknown

LaneScoreTasksSafety
Communication47.4%251
Compliance62.5%250
Domain comprehension63.7%250
Geospatial reasoning47.5%250
ISR reasoning42.8%250
Legal and ethical reasoning73.0%250
Planning support65.5%250
Robustness and calibration38.8%251
Safety37.3%253
Source evaluation60.8%251
Sovereign deployability66.7%250
Structured reporting69.9%251
#13

nvidia-build:thinkingmachines/inkling@default

55.5% Overall 57.3% Capability 52.7% Rel+Safety 44.04% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication45.1%250
Compliance34.0%252
Domain comprehension71.1%250
Geospatial reasoning41.5%250
ISR reasoning43.0%250
Legal and ethical reasoning82.8%250
Planning support62.1%250
Robustness and calibration45.0%251
Safety49.0%252
Source evaluation60.0%251
Sovereign deployability53.1%250
Structured reporting78.1%250
#14

nvidia-build:z-ai/glm-5.2@default

53.8% Overall 55.5% Capability 50.5% Rel+Safety 44.70% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication52.8%250
Compliance39.3%257
Domain comprehension66.6%250
Geospatial reasoning35.4%250
ISR reasoning36.0%250
Legal and ethical reasoning76.7%250
Planning support65.7%250
Robustness and calibration41.8%253
Safety44.1%251
Source evaluation59.8%251
Sovereign deployability54.4%250
Structured reporting71.9%250
#15

nvidia-build:nvidia/nemotron-3-ultra-550b-a55b@default

53.7% Overall 58.0% Capability 43.5% Rel+Safety 48.70% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-21 · scorer unknown

LaneScoreTasksSafety
Communication50.5%250
Compliance21.1%257
Domain comprehension67.7%250
Geospatial reasoning35.1%250
ISR reasoning36.2%250
Legal and ethical reasoning75.4%250
Planning support72.4%250
Robustness and calibration39.9%252
Safety37.6%251
Source evaluation66.1%250
Sovereign deployability62.4%250
Structured reporting78.2%250
#16

nvidia-build:minimaxai/minimax-m3@default

52.6% Overall 53.5% Capability 49.3% Rel+Safety 46.44% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication48.3%250
Compliance36.7%257
Domain comprehension59.6%250
Geospatial reasoning38.9%250
ISR reasoning37.4%250
Legal and ethical reasoning77.2%250
Planning support63.8%250
Robustness and calibration39.2%252
Safety44.0%251
Source evaluation55.4%250
Sovereign deployability57.9%250
Structured reporting71.3%250
#17

mlx-openai:qwen/qwen3.6-35b-a3b

52.4% Overall 55.1% Capability 47.2% Rel+Safety 68.64% Deploy

sovereign-deployable (declared) · sovereign-capable (declared) · edge-candidate (name-heuristic)

300/300 · scored 2026-06-10 · scorer unknown

LaneScoreTasksSafety
Communication42.9%250
Compliance35.7%253
Domain comprehension64.0%250
Geospatial reasoning38.6%250
ISR reasoning34.0%250
Legal and ethical reasoning78.3%250
Planning support74.2%250
Robustness and calibration33.8%250
Safety40.9%251
Source evaluation57.0%250
Sovereign deployability52.3%250
Structured reporting74.8%250
#18

gemini-cli:gemini-3.1-pro-preview

52.3% Overall 55.4% Capability 45.3% Rel+Safety 45.50% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-11 · scorer unknown

LaneScoreTasksSafety
Communication48.6%250
Compliance26.6%2511
Domain comprehension73.3%250
Geospatial reasoning33.9%250
ISR reasoning29.6%250
Legal and ethical reasoning75.8%250
Planning support71.3%250
Robustness and calibration38.3%251
Safety40.4%253
Source evaluation58.1%251
Sovereign deployability56.0%250
Structured reporting73.2%250
#19

nvidia-build:deepseek-ai/deepseek-v4-flash@default

51.7% Overall 55.5% Capability 42.0% Rel+Safety 48.30% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-21 · scorer unknown

LaneScoreTasksSafety
Communication45.0%250
Compliance30.6%258
Domain comprehension67.9%250
Geospatial reasoning42.0%250
ISR reasoning33.4%250
Legal and ethical reasoning71.5%250
Planning support71.2%250
Robustness and calibration34.8%252
Safety31.2%254
Source evaluation55.5%251
Sovereign deployability61.6%250
Structured reporting73.1%250
#20

gemini-cli:gemini-3.1-flash-lite

50.8% Overall 53.8% Capability 41.7% Rel+Safety 48.97% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-06-10 · scorer unknown

LaneScoreTasksSafety
Communication46.9%250
Compliance19.9%2512
Domain comprehension70.5%250
Geospatial reasoning30.3%251
ISR reasoning30.1%250
Legal and ethical reasoning71.1%250
Planning support68.5%250
Robustness and calibration36.8%252
Safety38.8%251
Source evaluation61.0%250
Sovereign deployability62.9%250
Structured reporting69.1%250
#21

nvidia-build:qwen/qwen3.5-397b-a17b@default

48.1% Overall 50.0% Capability 47.0% Rel+Safety 36.30% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication32.1%250
Compliance34.5%251
Domain comprehension61.9%250
Geospatial reasoning28.8%250
ISR reasoning29.6%250
Legal and ethical reasoning68.7%250
Planning support72.0%250
Robustness and calibration41.7%251
Safety43.2%250
Source evaluation52.7%250
Sovereign deployability37.6%250
Structured reporting73.3%250
#22

nvidia-build:qwen/qwen3-next-80b-a3b-instruct@default

47.6% Overall 49.5% Capability 42.8% Rel+Safety 43.64% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-23 · scorer unknown

LaneScoreTasksSafety
Communication41.5%251
Compliance39.3%253
Domain comprehension55.5%250
Geospatial reasoning26.1%250
ISR reasoning30.5%250
Legal and ethical reasoning67.3%250
Planning support70.8%250
Robustness and calibration30.0%252
Safety34.7%251
Source evaluation50.0%251
Sovereign deployability52.3%250
Structured reporting71.9%250
#23

nvidia-build:mistralai/mistral-medium-3.5-128b@default

46.6% Overall 49.4% Capability 38.9% Rel+Safety 45.64% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-24 · scorer unknown

LaneScoreTasksSafety
Communication38.0%250
Compliance21.1%2514
Domain comprehension58.0%250
Geospatial reasoning29.1%250
ISR reasoning34.7%250
Legal and ethical reasoning64.3%250
Planning support55.4%250
Robustness and calibration40.9%251
Safety29.5%252
Source evaluation61.6%250
Sovereign deployability56.3%250
Structured reporting69.0%250
#24

nvidia-build:openai/gpt-oss-20b@default

46.4% Overall 51.9% Capability 34.5% Rel+Safety 44.84% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-23 · scorer unknown

LaneScoreTasksSafety
Communication39.9%250
Compliance28.8%254
Domain comprehension63.1%250
Geospatial reasoning37.2%250
ISR reasoning33.1%250
Legal and ethical reasoning58.1%250
Planning support67.8%250
Robustness and calibration28.2%257
Safety22.7%252
Source evaluation49.5%251
Sovereign deployability54.7%250
Structured reporting72.7%250
#25

nvidia-build:google/gemma-4-31b-it@default

46.4% Overall 48.4% Capability 40.5% Rel+Safety 44.30% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication40.6%250
Compliance18.3%251
Domain comprehension64.9%250
Geospatial reasoning26.0%250
ISR reasoning17.2%250
Legal and ethical reasoning70.9%250
Planning support62.8%250
Robustness and calibration36.4%251
Safety36.2%252
Source evaluation57.2%250
Sovereign deployability53.6%250
Structured reporting70.1%250
#26

nvidia-build:nvidia/nemotron-3-nano-omni-30b-a3b-reasoning@default

46.3% Overall 50.0% Capability 36.5% Rel+Safety 45.10% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication27.0%251
Compliance21.1%2510
Domain comprehension60.6%250
Geospatial reasoning37.3%250
ISR reasoning32.3%250
Legal and ethical reasoning68.3%250
Planning support65.6%250
Robustness and calibration24.5%257
Safety32.1%252
Source evaluation56.7%250
Sovereign deployability55.2%250
Structured reporting70.5%250
#27

nvidia-build:mistralai/mistral-nemotron@default

46.0% Overall 48.2% Capability 38.2% Rel+Safety 47.36% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication48.1%250
Compliance21.8%2510
Domain comprehension53.3%250
Geospatial reasoning27.3%250
ISR reasoning35.4%250
Legal and ethical reasoning58.9%250
Planning support55.3%250
Robustness and calibration37.7%250
Safety34.5%252
Source evaluation54.5%250
Sovereign deployability59.7%250
Structured reporting63.4%250
#28

nvidia-build:nvidia/llama-3.3-nemotron-super-49b-v1.5@default

46.0% Overall 48.9% Capability 37.2% Rel+Safety 46.57% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-21 · scorer unknown

LaneScoreTasksSafety
Communication40.8%250
Compliance17.2%2512
Domain comprehension56.0%250
Geospatial reasoning31.7%250
ISR reasoning30.7%250
Legal and ethical reasoning61.2%250
Planning support58.8%250
Robustness and calibration36.9%252
Safety33.5%252
Source evaluation58.3%251
Sovereign deployability58.1%250
Structured reporting65.9%250
#29

nvidia-build:nvidia/nemotron-3-super-120b-a12b@default

45.6% Overall 49.6% Capability 34.8% Rel+Safety 46.84% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-21 · scorer unknown

LaneScoreTasksSafety
Communication42.2%250
Compliance22.4%259
Domain comprehension66.0%250
Geospatial reasoning26.9%250
ISR reasoning28.1%250
Legal and ethical reasoning61.1%250
Planning support64.1%250
Robustness and calibration23.9%254
Safety32.0%251
Source evaluation45.4%250
Sovereign deployability58.7%250
Structured reporting74.3%250
#30

nvidia-build:mistralai/mistral-large-3-675b-instruct-2512@default

43.1% Overall 46.2% Capability 37.7% Rel+Safety 37.77% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication44.6%250
Compliance22.7%2510
Domain comprehension70.8%250
Geospatial reasoning26.2%250
ISR reasoning31.0%251
Legal and ethical reasoning63.9%250
Planning support52.6%250
Robustness and calibration31.7%251
Safety32.6%252
Source evaluation52.3%250
Sovereign deployability40.5%250
Structured reporting45.8%250
#31

nvidia-build:meta/llama-3.3-70b-instruct@default

42.9% Overall 48.0% Capability 39.0% Rel+Safety 30.30% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-23 · scorer unknown

LaneScoreTasksSafety
Communication43.9%250
Compliance29.7%250
Domain comprehension52.7%250
Geospatial reasoning26.9%250
ISR reasoning21.9%250
Legal and ethical reasoning60.6%250
Planning support74.0%250
Robustness and calibration38.3%251
Safety27.6%252
Source evaluation48.9%250
Sovereign deployability25.6%250
Structured reporting67.3%250
#32

nvidia-build:nvidia/nemotron-3-nano-30b-a3b@default

42.9% Overall 45.1% Capability 35.7% Rel+Safety 43.77% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-21 · scorer unknown

LaneScoreTasksSafety
Communication27.0%250
Compliance21.4%256
Domain comprehension54.4%250
Geospatial reasoning27.7%250
ISR reasoning21.9%250
Legal and ethical reasoning64.8%250
Planning support60.6%250
Robustness and calibration26.0%257
Safety30.7%251
Source evaluation54.8%252
Sovereign deployability52.5%250
Structured reporting69.3%250
#33

nvidia-build:mistralai/mistral-small-4-119b-2603@default

42.8% Overall 46.9% Capability 34.8% Rel+Safety 39.10% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication32.4%250
Compliance16.7%2516
Domain comprehension51.1%250
Geospatial reasoning26.4%250
ISR reasoning33.4%250
Legal and ethical reasoning66.0%250
Planning support64.3%250
Robustness and calibration26.9%256
Safety29.8%253
Source evaluation52.6%250
Sovereign deployability43.2%250
Structured reporting68.4%250
#34

nvidia-build:google/diffusiongemma-26b-a4b-it@default

41.7% Overall 43.7% Capability 38.5% Rel+Safety 37.64% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication26.7%251
Compliance25.6%258
Domain comprehension57.4%250
Geospatial reasoning28.6%250
ISR reasoning21.6%250
Legal and ethical reasoning59.7%250
Planning support45.9%250
Robustness and calibration31.3%252
Safety37.3%252
Source evaluation56.5%250
Sovereign deployability40.3%250
Structured reporting69.3%250
#35

nvidia-build:nvidia/ising-calibration-1.5-31b@default

41.6% Overall 46.6% Capability 34.4% Rel+Safety 35.24% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication49.1%250
Compliance15.9%2514
Domain comprehension46.7%250
Geospatial reasoning27.4%251
ISR reasoning25.7%250
Legal and ethical reasoning62.6%252
Planning support65.3%250
Robustness and calibration21.0%253
Safety38.1%253
Source evaluation46.5%251
Sovereign deployability35.5%250
Structured reporting65.7%250
#36

nvidia-build:nvidia/nvidia-nemotron-nano-9b-v2@default

41.2% Overall 44.6% Capability 32.5% Rel+Safety 41.90% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication31.5%250
Compliance15.3%2513
Domain comprehension44.4%251
Geospatial reasoning30.0%250
ISR reasoning30.6%250
Legal and ethical reasoning63.4%250
Planning support62.2%250
Robustness and calibration18.6%2510
Safety32.7%250
Source evaluation47.1%251
Sovereign deployability48.8%250
Structured reporting66.1%250
#37

nvidia-build:openai/gpt-oss-120b@high

40.9% Overall 45.1% Capability 28.8% Rel+Safety 47.10% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-23 · scorer unknown

LaneScoreTasksSafety
Communication39.7%250
Compliance19.7%258
Domain comprehension48.6%250
Geospatial reasoning41.9%250
ISR reasoning31.5%250
Legal and ethical reasoning42.8%250
Planning support42.3%250
Robustness and calibration27.5%250
Safety25.4%252
Source evaluation49.7%251
Sovereign deployability59.2%250
Structured reporting62.0%250
#38

nvidia-build:poolside/laguna-xs-2.1@default

39.9% Overall 44.1% Capability 33.9% Rel+Safety 35.50% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-08-06 · scorer unknown

LaneScoreTasksSafety
Communication44.8%250
Compliance16.6%2513
Domain comprehension35.4%250
Geospatial reasoning26.2%250
ISR reasoning25.4%250
Legal and ethical reasoning61.8%250
Planning support65.3%250
Robustness and calibration23.4%257
Safety33.6%250
Source evaluation44.0%250
Sovereign deployability36.0%250
Structured reporting67.2%250
#39

nvidia-build:meta/llama-4-maverick-17b-128e-instruct@default

39.5% Overall 45.1% Capability 36.9% Rel+Safety 25.24% Deploy

hosted-api (declared) · hosted

300/300 · scored 2026-07-22 · scorer unknown

LaneScoreTasksSafety
Communication31.2%250
Compliance29.5%254
Domain comprehension58.5%250
Geospatial reasoning26.2%250
ISR reasoning25.7%250
Legal and ethical reasoning61.7%250
Planning support51.0%250
Robustness and calibration28.5%253
Safety28.0%251
Source evaluation51.3%251
Sovereign deployability15.5%250
Structured reporting71.5%250

Caveats: scores come from a deterministic rubric grader (LLM-judge agreement provisional, kappa 0.156 measured 2026-06-27 — not a validation). Deployment profiles are operator-declared, not verified; edge-candidate is a model-name heuristic. Adjacent ranks are often not statistically separated — compare bands, not rank numbers.