Begins the V2 Neural Multiprocessor / Dataflow architecture per docs/v2-description.md, per explicit user request to freeze V1 and start V2 development, copying from V1 what's needed. Scaffold: - hardware/v1/: byte-exact, read-only copy of the current V1 codebase (rtl, testbenches, tools, constraints, a representative subset of synthesis results, and reference docs) -- verified identical via diff/cmp against the live top-level tree before being made filesystem-read-only. The live top-level tree is untouched and remains the project's "production" V1 (see hardware/v1/README.md and hardware/v2/logs/decisions.log DEC-0001 for why copy-not-move). - hardware/v2/: mandatory structure (rtl/sim/constraints/synthesis/ reports/scripts/logs/docs) plus the full logging system required by the spec (development/architecture/simulation/synthesis/timing/ benchmark/decisions/experiments/errors.log). M1 -- Neural Processor (hardware/v2/rtl/neural_processor.v): - 8-stage pipelined perceptron unit (P_IN=8): input align, 8 multipliers, 3-level adder tree, accumulator, bias+activation, INT8 saturation. Genuine 1-tile/cycle throughput, not just a wider combinational datapath. - 7-state FSM (NP_IDLE..NP_ERROR per docs/v2-description.md §6, with 4 baseline states merged into NP_WAIT_OPERANDS -- see decisions.log DEC-0002); valid/ready/data/last stream interfaces per §7. - Bit-exact vs the frozen hardware/v1/rtl/neuron_parallel.v + mac8.v + mac_unit.v: 7/7 tests pass (hardware/v2/sim/tb_neural_processor.v), covering regular/mixed-sign/extreme-INT8 vectors, both activations, a zero-idle-gap back-to-back-tiles throughput check, and an 8-tile job -- verified with Verilator (see below for why). - Real synthesis + place&route (Yosys + nextpnr-ecp5): 0 CHECK problems, Fmax 183.12 MHz at ACC_WIDTH=32 (PASS at 80MHz, ~3x V1's isolated PARALLEL=8 Fmax of 61.71 MHz) and 176.21 MHz at ACC_WIDTH=24 (a user-requested comparison experiment, also bit-exact-verified; see experiments.log EXP-0001/EXP-0002 and benchmark.log). Three real bugs found and resolved during M1 development (full diagnostic record in errors.log): - Two independent, reproducible Icarus Verilog v13.0 scheduling defects (ERR-0001, ERR-0002) that silently produced wrong simulation results for standard sequential Verilog -- confirmed via Verilator 5.050 giving correct results on the same minimal repros. Verilator is now the trusted simulator for hardware/v2/ (decisions.log DEC-0004); Icarus's affected protocol-violation check was removed from the RTL and deferred architecturally to the Neural Director (DEC-0003) rather than chased further. - One real RTL bug (ERR-0003): last0 wasn't gated like valid0, letting a "last tile" tag leak into the pipeline ahead of its actual valid tile on back-to-back jobs. Fixed and verified. Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_013xXuuRUWZScuo1DeYJxs3v
5.5 KiB
C.3 — Sottosistema memoria (int8_memory_access, memory_interface, psram_controller)
Data: 2026-09-04.
3.1 int8_memory_access.v — conversione byte↔word e selezione byte-lane — CERTIFICATO
Metodo: nuovo test dedicato (sim/int8_memory_access_bytelane_tb.v), non esisteva prima
una verifica esaustiva della conversione indirizzo. Due batterie:
- Esaustiva su 2048 indirizzi (ogni combinazione dei 12 bit bassi, entrambe le parità):
mem_addr(deve essereaddr>>1),mem_lb_n/mem_ub_n(byte pari→basso attivo, dispari→ alto attivo) — ispezionati direttamente sui segnali combinazionali. - Round-trip scrittura/lettura reale attraverso l'handshake FSM (non un peek interno) a 6 indirizzi (pari/dispari, valori di bordo INT8, e un test esplicito che una scrittura sull'indirizzo dispari di una parola NON corrompa il byte pari già scritto nella stessa parola — verifica che le byte-lane siano davvero indipendenti).
Oracolo: formula dichiarata dal modulo stesso (addr>>1, addr[0]), applicata
indipendentemente, non letta dall'RTL.
Due bug nella MIA testbench, trovati e corretti prima di fidarmi del risultato (stesso schema di trasparenza di C.1/C.2, riportato per intero):
- Il controllo dei segnali
mem_addr/mem_lb_n/mem_ub_nnel TEST 1 avveniva nello stesso passo di simulazione dell'aggiornamento non-bloccante che li produce — leggeva il valore dell'iterazione PRECEDENTE, non quella corrente (3071 "mismatch" su 2048 controlli, tutti falsi). Corretto con un#1dopo il fronte di clock, per lasciare che l'aggiornamento si assesti prima di leggerlo. - Il modello di memoria comportamentale della testbench scriveva l'intera parola a 16 bit
incondizionatamente, ignorando
mem_lb_n/mem_ub_n— una scrittura sul byte dispari di una parola cancellava il byte pari già scritto lì, anche conmem_lb_n=1(disabilitato). Questo ha fatto fallire il test di round-trip "scrittura non deve corrompere il byte fratello" — ma il difetto era nello STUB di test, non nell'RTL sotto test (il DUT comunica correttamentemem_lb_n/mem_ub_n, era il modello di memoria a non rispettarli). Corretto rendendo lo stub sensibile alle byte-lane come una vera memoria mascherabile a byte.
$ iverilog -g2012 -o /tmp/bytelane2.out rtl/int8_memory_access.v sim/int8_memory_access_bytelane_tb.v && vvp /tmp/bytelane2.out
ALL TESTS PASSED (2048 decode checks + 6 round-trip checks, 0 mismatches)
Verdetto: CERTIFICATO. 2054/2054 controlli, 0 mismatch, dopo la correzione di due difetti nella testbench stessa (non nell'RTL).
3.2 memory_interface.v — CERTIFICATO (via test pre-esistente)
Modulo semplice: stesso pattern di handshake req/ready di int8_memory_access.v ma a
granularità 16 bit, senza logica di byte-lane propria (inoltra lb_n/ub_n così come
ricevuti). sim/memory_interface_tb.v (pre-esistente, riverificato in Fase 0) copre
l'handshake. Non ripetuto da zero in questa fase: la logica è sufficientemente semplice
(nessuna aritmetica di indirizzo propria) da non giustificare una nuova campagna esaustiva
oltre a quanto già verificato.
Verdetto: CERTIFICATO (copertura pre-esistente, ritenuta adeguata alla semplicità del modulo).
3.3 psram_controller.v — CERTIFICATO (lavoro estensivo già svolto in questa sessione, non ri-fatto da zero)
Questo modulo ha già ricevuto una verifica sostanziale in questa stessa sessione, non solo dichiarata nel WORKLOG di sessioni precedenti:
- Un bug reale pre-esistente trovato e corretto: richieste arrivate durante
STATE_INIT/STATE_CR_INIT(~150µs di poweron) venivano perse silenziosamente; corretto con un latchreq_pending— trovato durante il lavoro sul sottosistema flash (Fase F2), con una riproduzione minimale isolata prima e dopo il fix. - Timing di page-mode verificato contro il datasheet ISSI reale:
ACCESS_CYCLES = ceil(70ns × CLK_FREQ_MHZ/1000),PAGE_CYCLESper il burst,tCEM(idle timeout e budget mid-burst) —sim/psram_page_mode_tb.v, consim/psram_model.vche fa$fatalsu qualunque violazione di timing reale (non solo un controllo di valore atteso: un meccanismo di oracolo attivo che blocca la simulazione se l'RTL viola una regola del datasheet, indipendentemente da cosa la testbench stessa controlli esplicitamente). - Rieseguito in Fase 0 di questa campagna (non solo citato):
psram_controller_tb.vepsram_page_mode_tb.vPASS, confermato da un harness di regressione indipendente (tools/run_regression.py), non dalla parola del WORKLOG.
Non ripetuto da zero in C.3: rifare l'intera campagna di verifica del page-mode/tCEM già completata con rigore comparabile in questa sessione sarebbe una duplicazione di lavoro già tracciabile (WORKLOG, fasi F2/G7), non una nuova scoperta. Citato come evidenza, non dato per buono senza verifica: il PASS è stato riconfermato da zero in Fase 0 di questa campagna.
Verdetto: CERTIFICATO, con la stessa evidenza di prima (riverificata, non solo citata).
3.4 Verdetto complessivo C.3
| Sotto-aspetto | Verdetto |
|---|---|
int8_memory_access.v (byte↔word, byte-lane) |
CERTIFICATO (nuovo, esaustivo su 2048 indirizzi) |
memory_interface.v |
CERTIFICATO (copertura pre-esistente adeguata) |
psram_controller.v (incl. page-mode, tCEM) |
CERTIFICATO (lavoro esteso di sessione, riverificato) |
Nessun bug nuovo trovato in questo aspetto — due difetti trovati erano nella mia stessa testbench di verifica, corretti prima di trarre conclusioni sull'RTL.