grammar: 문법 문서를 기계가 읽는 소스로 — LL(1)이 처음으로 검증된다

설명서와 파서가 어긋나 있었다. 그냥 어긋난 게 아니라, 그 설명서를 안 읽고
"else if가 안 된다"고 마찰 보고서에 잘못 적었다 — 설명서로서 제 역할을 한
번도 못 했다는 뜻이다.

lib/ebnf.ml: EBNF를 데이터로 읽는다. nullable, FIRST, FOLLOW를 계산하고
LL(1) 충돌을 보고한다. 매개변수 프로덕션(name<p>)을 지원한다 — expr_ns와
목록을 복제 없이 적기 위한 것이다.

문법 첫머리의 "설계 제약: LL(1)"은 지금까지 사람의 주장이었다. 기계로 재니
충돌 18건이 나왔다. 세 부류였다:
- 구조적 3건: stmt(assign/expr), primary(ident/struct_lit), pattern —
  파서는 왼쪽 인수분해를 손으로 했는데 문법에 안 적혀 있었다
- 후행 콤마 9건: X , { "," , X } , [ "," ]는 콤마를 본 시점에 갈리지 않는다.
  우재귀로 다시 적었다
- 줄바꿈 흡수 6건: 어느 쪽이 먹어도 파스 트리가 같다. greedy 규칙을 표기에
  명시하고 그렇게 해소되는 것만 따로 분류한다

지금은 진짜 충돌 0건이고, 테스트가 이를 고정한다.

병렬 조사에서 나온 드리프트도 모두 반영했다:
- named_type, name_pattern에 한정 이름(Shapes.Shape, Shapes.Circle)
- name_pattern이 인자 0개와 괄호 없는 한정 생성자를 받는다
- string_lit의 이스케이프
- cap_method의 gen_params (파서가 이미 허용하고 있었다)
- field/variant/field_init/arm 사이의 콤마는 필수다
- stmt 사이의 NEWLINE도 필수다 — 선택적으로 적었더니 그것 하나가 LL(1)
  충돌 셋을 만들었다
- { NEWLINE }을 전부 [ NEWLINE ]으로. 렉서가 연속 줄바꿈을 만들 수 없다

expr_ns는 산문 주석이었고 파서 상태 플래그로 구현돼 있었다. 매개변수
프로덕션으로 형식화해 문맥자유가 됐다.

렉서 쪽: Token.next_kind가 모든 토큰을 한 번씩 잇는다. 나열이 빠지면
컴파일러가 지적한다. 문법 문서의 키워드 표와 줄 끝 판정 목록은 이제
lib/lexical_doc.ml이 거기서 생성하고 테스트가 대조한다.

Co-Authored-By: Claude Opus 5 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_019ZVDeU6KLuUVL3gs18Hm3E
This commit is contained in:
2026-08-30 17:03:25 +09:00
co-authored by Claude Opus 5
parent 6c0d08b6b0
commit bde940eda3
8 changed files with 1049 additions and 80 deletions
+67
View File
@@ -152,6 +152,73 @@ let show_kind = function
let show { kind; pos } =
Printf.sprintf "%d:%d %s" pos.line pos.col (show_kind kind)
(* 모든 토큰 종류를 한 번씩 잇는 사슬. 아래 match가 전체 나열이므로 토큰을
추가하면 컴파일러가 여기를 지적한다 — 목록이 조용히 낡지 않는다.
문법 문서의 어휘 절이 이 나열에서 생성된다. *)
let next_kind = function
| Ident _ -> Some (Int "")
| Int _ -> Some (Str "")
| Str _ -> Some Kw_pub
| Kw_pub -> Some Kw_fn
| Kw_fn -> Some Kw_struct
| Kw_struct -> Some Kw_enum
| Kw_enum -> Some Kw_capability
| Kw_capability -> Some Kw_const
| Kw_const -> Some Kw_import
| Kw_import -> Some Kw_as
| Kw_as -> Some Kw_reexport
| Kw_reexport -> Some Kw_let
| Kw_let -> Some Kw_mut
| Kw_mut -> Some Kw_own
| Kw_own -> Some Kw_affine
| Kw_affine -> Some Kw_copyable
| Kw_copyable -> Some Kw_effects
| Kw_effects -> Some Kw_return
| Kw_return -> Some Kw_if
| Kw_if -> Some Kw_else
| Kw_else -> Some Kw_match
| Kw_match -> Some Kw_scope
| Kw_scope -> Some Kw_true
| Kw_true -> Some Kw_false
| Kw_false -> Some LParen
| LParen -> Some RParen
| RParen -> Some LBrace
| LBrace -> Some RBrace
| RBrace -> Some LBracket
| LBracket -> Some RBracket
| RBracket -> Some Comma
| Comma -> Some Colon
| Colon -> Some Dot
| Dot -> Some Arrow
| Arrow -> Some FatArrow
| FatArrow -> Some Question
| Question -> Some Underscore
| Underscore -> Some Eq
| Eq -> Some EqEq
| EqEq -> Some Bang
| Bang -> Some BangEq
| BangEq -> Some Lt
| Lt -> Some Le
| Le -> Some Gt
| Gt -> Some Ge
| Ge -> Some Plus
| Plus -> Some Minus
| Minus -> Some Star
| Star -> Some Slash
| Slash -> Some Percent
| Percent -> Some AmpAmp
| AmpAmp -> Some PipePipe
| PipePipe -> Some Pipe
| Pipe -> Some Newline
| Newline -> Some Eof
| Eof -> None
let all_kinds =
let rec go k acc =
match next_kind k with None -> List.rev (k :: acc) | Some n -> go n (k :: acc)
in
go (Ident "") []
(* 줄 끝에서 문 구분자를 삽입할지 결정한다 (grammar.ebnf 어휘 절).
값으로 끝날 수 있는 토큰 뒤에서만 삽입하므로, 연산자나 여는 괄호로
끝나는 줄은 다음 줄로 이어진다. *)