Google · 모델

Gemini 3.5 Flash

API출시 2026년 5월 19일Google/gemini-3.5-flash공식 문서 ↗
종합 레이팅1227 · 44위레이팅 벤치 29개
컨텍스트 창1.0M최대 출력 66K
가격 (입력 / 출력, 1M 토큰)$1.50 / $9.00혼합 $3.38
파라미터—
라이선스commercial API
벤치 점수32개코딩·에이전트·추론·지식·멀티모달·과학·보안·속도·비용

AI AI 해설

2026년 10월 9일 생성

멀티모달 벤치가 돋보이지만 코딩·과학 레이팅은 신중히 볼 모델

포지션

상용 API 모델로 종합 레이팅 1106(55위), 가중 비교 9.4다. 레이팅은 같은 벤치 비교로 만든 상대 지표이며, 에이전트 1038(30위), 멀티모달 1079로 집계됐다.

벤치마크

MMMU-Pro는 LLM Stats 집계에서 83.6%(미검증), 1/61이다. Terminal-Bench 2.0은 76.2%(미검증), 5/40이며 OSWorld-Verified는 78.4%(미검증), 12/26이다.

코딩·전문 분야

코딩 레이팅은 976(64위), 과학·보안은 944다. SWE-bench Pro는 Public 731 프로필에서 55.1%, 41/63이며, LLM Stats 집계에서는 55.1%(미검증), 39/55다. 서로 다른 프로필의 순위는 직접 비교하기 어렵다.

도입 조건

컨텍스트 1.0M, 최대 출력 66K를 지원한다. 가격은 1M 토큰 기준 입력 $1.50, 출력 $9.00이며 라이선스는 commercial API다. 다수 벤치가 미검증으로 표시돼 실제 업무 평가는 별도로 필요하다.

수집된 벤치·가격·출시 숫자만 입력으로 받아 LLM이 작성했고, 입력에 없는 숫자가 나오면 폐기합니다. 사용 결정은 원문 출처와 직접 평가로 확인하세요.

분야레이팅분야 순위벤치 수
코딩1015835
에이전트1057437
추론·지식11725011
멀티모달1145143
과학·보안1105283
차트를 불러오는 중입니다…

분야 레이팅은 그 분야 벤치에서의 비교만으로 계산합니다. 회색 선은 종합 1위 모델입니다.

벤치마크 점수

32개 · 프로필별 순위

코딩

벤치프로필점수순위백분위출처
Terminal-Bench HardArtificial Analysis39.4%29 / 9369확인됨 ↗
SWE-bench ProPublic 73155.1%41 / 6335확인됨 ↗
SWE-bench ProLLM Stats 집계55.1%39 / 5530자기보고 ↗
Terminal-Bench 2.0LLM Stats 집계76.2%5 / 4090자기보고 ↗
DeepSWE 1.1LLM Stats 집계37%36 / 398인용 ↗

에이전트

벤치프로필점수순위백분위출처
ToolathlonLLM Stats 집계56.5%13 / 3868자기보고 ↗
MCP Atlas · PublicLLM Stats 집계83.6%5 / 3689자기보고 ↗
OSWorld-VerifiedLLM Stats 집계78.4%12 / 2656자기보고 ↗
Finance Agent v2LLM Stats 집계57.9%2 / 2195인용 ↗
Legal Agent BenchmarkLLM Stats 집계0.8%10 / 1431인용 ↗
GDPval-AA v2OpenAI 공개 평가1,3497 / 814인용 ↗
Finance AgentLLM Stats 집계57.9%5 / 843자기보고 ↗

추론·지식

벤치프로필점수순위백분위출처
Humanity's Last ExamArtificial Analysis41.3%28 / 14181확인됨 ↗
Intelligence IndexArtificial Analysis33.640 / 14172확인됨 ↗
AA-LCRArtificial Analysis74.3%68 / 13951확인됨 ↗
CritPTArtificial Analysis10.9%43 / 13970확인됨 ↗
GPQA DiamondArtificial Analysis92.1%20 / 13085확인됨 ↗
IFBenchArtificial Analysis74.6%20 / 9780확인됨 ↗
τ²-Bench TelecomArtificial Analysis95.6%12 / 9689확인됨 ↗
Humanity's Last ExamLLM Stats 집계40.2%34 / 6448자기보고 ↗
LiveBenchLLM Stats 집계75.0%10 / 2359인용 ↗
MRCR v2 (8-needle)LLM Stats 집계26.6%16 / 2229자기보고 ↗
ARC-AGI v2LLM Stats 집계72.1%5 / 1469자기보고 ↗
Blueprint-Bench 2LLM Stats 집계33.6%2 / 20자기보고 ↗

멀티모달

벤치프로필점수순위백분위출처
MMMU-ProArtificial Analysis83.9%7 / 6991확인됨 ↗
MMMU-ProLLM Stats 집계83.6%1 / 61100자기보고 ↗
CharXiv-RLLM Stats 집계84.2%18 / 4864자기보고 ↗

과학·보안

벤치프로필점수순위백분위출처
AA-Omniscience AccuracyArtificial Analysis51.1%17 / 13988확인됨 ↗
AA-Omniscience IndexArtificial Analysis20.820 / 13986확인됨 ↗
GeneBench ProOpenAI 공개 평가8.1%6 / 717인용 ↗

속도·비용

벤치프로필점수순위백분위출처
Artificial Analysis Output SpeedArtificial Analysis195 tok/s13 / 10889확인됨 ↗
Artificial Analysis Time to First ChunkArtificial Analysis12.68초76 / 10830확인됨 ↗

순위는 같은 프로필(같은 문항·하네스·출처)에서 측정된 모델 중 위치입니다. * 는 자기보고·인용 등 검증되지 않은 값입니다.

레이팅이 비슷한 모델

Google의 다른 모델

공급사 →